Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 3151–3200 of 6433 papers

Title	Date	Tasks	Status
Interactive spatial speech recognition maps based on simulated speech recognition experiments	Apr 1, 2021	speech-recognitionSpeech Recognition	—Unverified
Interactive Spoken Content Retrieval by Deep Reinforcement Learning	Sep 16, 2016	Deep Reinforcement LearningQ-Learning	—Unverified
InterAug: Augmenting Noisy Intermediate Predictions for CTC-based ASR	Apr 1, 2022	Decoderspeech-recognition	—Unverified
InterBiasing: Boost Unseen Word Recognition through Biasing Intermediate Predictions	Jun 21, 2024	speech-recognitionSpeech Recognition	—Unverified
Enhanced CORILGA: Introducing the Automatic Phonetic Alignment Tool for Continuous Speech	May 1, 2016	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Inter-KD: Intermediate Knowledge Distillation for CTC-Based Automatic Speech Recognition	Nov 28, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Inter-linguistic Phonetic Composition (IPC): A Theoretical and Computational Approach to Enhance Second Language Pronunciation	Nov 17, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
Intermediate-layer output Regularization for Attention-based Speech Recognition with Shared Decoder	Jul 9, 2022	Decoderspeech-recognition	—Unverified
Branchformer: Parallel MLP-Attention Architectures to Capture Local and Global Context for Speech Recognition and Understanding	Jul 6, 2022	speech-recognitionSpeech Recognition	—Unverified
InterMPL: Momentum Pseudo-Labeling with Intermediate CTC Loss	Nov 2, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Brain Signals to Rescue Aphasia, Apraxia and Dysarthria Speech Recognition	Feb 28, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Internal Language Model Estimation based Language Model Fusion for Cross-Domain Code-Switching Speech Recognition	Jul 9, 2022	Language ModelingLanguage Modelling	—Unverified
Internal Language Model Estimation for Domain-Adaptive End-to-End Speech Recognition	Nov 3, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Internal Language Model Estimation Through Explicit Context Vector Learning for Attention-based Encoder-decoder ASR	Jan 26, 2022	DecoderLanguage Modeling	—Unverified
Internal Language Model Training for Domain-Adaptive End-to-End Speech Recognition	Feb 2, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
CTC-Assisted LLM-Based Contextual ASR	Nov 10, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Interpolated Dirichlet Class Language Model for Speech Recognition Incorporating Long-distance N-grams	Aug 1, 2014	Language ModelingLanguage Modelling	—Unverified
Interpretable Convolutional Filters with SincNet	Nov 23, 2018	Distant Speech RecognitionInductive Bias	—Unverified
Interpretable Convolutional Filters with SincNet	Oct 21, 2018	Inductive Biasspeech-recognition	—Unverified
Interpretable Dysarthric Speaker Adaptation based on Optimal-Transport	Mar 14, 2022	Domain Adaptationspeech-recognition	—Unverified
English Conversational Telephone Speech Recognition by Humans and Machines	Mar 6, 2017	Language ModelingLanguage Modelling	—Unverified
Interpreting the Predictions of Complex ML Models by Layer-wise Relevance Propagation	Nov 24, 2016	General Classificationimage-classification	—Unverified
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding	Oct 21, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Intra-layer Nonuniform Quantization for Deep Convolutional Neural Network	Jul 10, 2016	ClusteringGeneral Classification	—Unverified
Intra-Speaker Topic Modeling for Improved Multi-Party Meeting Summarization with Integrated Random Walk	Jun 1, 2012	Meeting SummarizationSpeech Recognition	—Unverified
Cumulative Adaptation for BLSTM Acoustic Models	Jun 14, 2019	Acoustic ModellingAutomatic Speech Recognition	—Unverified
Introducing Semantics into Speech Encoders	Nov 15, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Introduction d'informations s\'emantiques dans un syst\`eme de reconnaissance de la parole (Despite spectacular advances in recent years, the Automatic Speech Recognition (ASR) systems still make mistakes, especially in noisy environments)	Jun 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Introduction to speech recognition	Feb 1, 2024	Dynamic Time Warpingspeech-recognition	—Unverified
Introspection for convolutional automatic speech recognition	Nov 1, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Invariant Representations for Noisy Speech Recognition	Nov 27, 2016	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Investigating Confidence Estimation Measures for Speaker Diarization	Jun 24, 2024	speaker-diarizationSpeaker Diarization	—Unverified
Investigating data partitioning strategies for crosslinguistic low-resource ASR evaluation	Aug 26, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Investigating End-to-End ASR Architectures for Long Form Audio Transcription	Sep 18, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Curvature: A signature for Action Recognition in Video Sequences	Apr 30, 2019	Action RecognitionFew-Shot Learning	—Unverified
Investigating Lexical Replacements for Arabic-English Code-Switched Data Augmentation	May 25, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
English Broadcast News Speech Recognition by Humans and Machines	Apr 30, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
探究新穎語句模型化技術於節錄式語音摘要 (Investigating Novel Sentence Modeling Techniques for Extractive Speech Summarization) [In Chinese]	Oct 1, 2014	Language ModellingSentence	—Unverified
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution	Dec 23, 2024	Audio Deepfake DetectionDeepFake Detection	—Unverified
Investigating Speech Recognition for Improving Predictive AAC	Jun 1, 2019	Language ModelingLanguage Modelling	—Unverified
Investigating Target Set Reduction for End-to-End Speech Recognition of Hindi-English Code-Switching Data	Jul 15, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Investigating the 'Autoencoder Behavior' in Speech Self-Supervised Models: a focus on HuBERT's Pretraining	May 14, 2024	Self-Supervised Learningspeech-recognition	—Unverified
Investigating the effect of auxiliary objectives for the automated grading of learner English speech transcriptions	Jul 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Investigating self-supervised, weakly supervised and fully supervised training approaches for multi-domain automatic speech recognition: a study on Bangladeshi Bangla	Oct 24, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Cycle-Consistent GAN Front-End to Improve ASR Robustness to Perturbed Speech	Oct 22, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Attentive Adversarial Learning for Domain-Invariant Training	Apr 28, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A non-expert Kaldi recipe for Vietnamese Speech Recognition System	Dec 1, 2016	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Investigating the Impact of Cross-lingual Acoustic-Phonetic Similarities on Multilingual Speech Recognition	Jul 7, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Accelerating Minibatch Stochastic Gradient Descent using Typicality Sampling	Mar 11, 2019	Reinforcement LearningReinforcement Learning (RL)	—Unverified
Improving sequence-to-sequence speech recognition training with on-the-fly data augmentation	Oct 29, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 64 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified