Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2701–2750 of 6433 papers

Title	Date	Tasks	Status
Gradient Norm-based Fine-Tuning for Backdoor Defense in Automatic Speech Recognition	Feb 3, 2025	Automatic Speech Recognitionbackdoor defense	—Unverified
homeService: Voice-enabled assistive technology in the home using cloud-based automatic speech recognition	Aug 1, 2013	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Gram-CTC: Automatic Unit Selection and Target Decomposition for Sequence Labelling	Mar 1, 2017	Computational Efficiencyspeech-recognition	—Unverified
Grammar Based Speaker Role Identification for Air Traffic Control Speech Recognition	Aug 27, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Grammatical vs Spelling Error Correction: An Investigation into the Responsiveness of Transformer-based Language Models using BART and MarianMT	Mar 25, 2024	Optical Character Recognition (OCR)speech-recognition	—Unverified
Granary: Speech Recognition and Translation Dataset in 25 European Languages	May 19, 2025	HallucinationPunctuation Restoration	—Unverified
Homophone-based Label Smoothing in End-to-End Automatic Speech Recognition	Apr 7, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Enhancing Multilingual Speech Recognition through Language Prompt Tuning and Frame-Level Language Adapter	Sep 18, 2023	parameter-efficient fine-tuningspeech-recognition	—Unverified
Graph Databases for Designing High-Performance Speech Recognition Grammars	Jan 1, 2017	Language ModelingLanguage Modelling	—Unverified
Graph Meets LLM: A Novel Approach to Collaborative Filtering for Robust Conversational Understanding	May 23, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bridging the Gap between Spatial and Spectral Domains: A Survey on Graph Neural Networks	Feb 27, 2020	Deep Learningimage-classification	—Unverified
Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling	Dec 21, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
GRASS: the Graz corpus of Read And Spontaneous Speech	May 1, 2014	Speech Recognition	—Unverified
Comparison of echo state network output layer classification methods on noisy data	Mar 13, 2017	Event DetectionGeneral Classification	—Unverified
Grouping Language Model Boundary Words to Speed K--Best Extraction from Hypergraphs	Jun 1, 2013	Language ModelingLanguage Modelling	—Unverified
Grow and Prune Compact, Fast, and Accurate LSTMs	May 30, 2018	Image Captioningspeech-recognition	—Unverified
Comparison of Grapheme-to-Phoneme Conversion Methods on a Myanmar Pronunciation Dictionary	Dec 1, 2016	Active LearningAutomatic Speech Recognition	—Unverified
Guided contrastive self-supervised pre-training for automatic speech recognition	Oct 22, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Comparison of Lattice-Free and Lattice-Based Sequence Discriminative Training Criteria for LVCSR	Jul 1, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Guided-TTS: A Diffusion Model for Text-to-Speech via Classifier Guidance	Nov 23, 2021	speech-recognitionSpeech Recognition	—Unverified
Guiding CTC Posterior Spike Timings for Improved Posterior Fusion and Knowledge Distillation	Apr 17, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Comparison of Neural Network Architectures for Spectrum Sensing	Jul 15, 2019	speech-recognitionSpeech Recognition	—Unverified
Gujarati-English Code-Switching Speech Recognition using ensemble prediction of spoken language	Mar 12, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
Hallucination of speech recognition errors with sequence to sequence learning	Mar 23, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models	Jan 3, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Halving transcription time: A fast, user-friendly and GDPR-compliant workflow to create AI-assisted transcripts for content analysis	Mar 17, 2025	Automatic Speech Recognitionspeech-recognition	—Unverified
Handling and extracting key entities from customer conversations using Speech recognition and Named Entity recognition	Nov 28, 2022	named-entity-recognitionNamed Entity Recognition	—Unverified
Handwriting recognition for Scottish Gaelic	Jun 1, 2022	Handwriting Recognitionspeech-recognition	—Unverified
Bridging the Gap Between Monaural Speech Enhancement and Recognition with Distortion-Independent Acoustic Modeling	Mar 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hard Sample Mining for the Improved Retraining of Automatic Speech Recognition	Apr 17, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Another Point of View on Visual Speech Recognition	Aug 20, 2023	Landmark-based Lipreadingspeech-recognition	—Unverified
Hardware-Guided Symbiotic Training for Compact, Accurate, yet Execution-Efficient LSTM	Jan 30, 2019	Language ModelingLanguage Modelling	—Unverified
Hardware Implementation of Hyperbolic Tangent Function using Catmull-Rom Spline Interpolation	Jul 13, 2020	Object Recognitionspeech-recognition	—Unverified
A Speech-enabled Fixed-phrase Translator for Healthcare Accessibility	Aug 1, 2021	Machine Translationspeech-recognition	—Unverified
HARK Side of Deep Learning -- From Grad Student Descent to Automated Machine Learning	Apr 16, 2019	BIG-bench Machine LearningDecision Making	—Unverified
Completely Unsupervised Speech Recognition By A Generative Adversarial Network Harmonized With Iteratively Refined Hidden Markov Models	Apr 8, 2019	Generative Adversarial Networkspeech-recognition	—Unverified
Enhancing Lyrics Transcription on Music Mixtures with Consistency Loss	Jun 3, 2025	Automatic Lyrics TranscriptionAutomatic Speech Recognition	—Unverified
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition	Sep 19, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Harnessing Transfer Learning from Swahili: Advancing Solutions for Comorian Dialects	Dec 9, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
HASP: A High-Performance Adaptive Mobile Security Enhancement Against Malicious Speech Recognition	Sep 4, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
HausaNLP: Current Status, Challenges and Future Directions for Hausa Natural Language Processing	May 20, 2025	Language ModelingLanguage Modelling	—Unverified
Have best of both worlds: two-pass hybrid and E2E cascading framework for speech recognition	Oct 10, 2021	speech-recognitionSpeech Recognition	—Unverified
Head-synchronous Decoding for Transformer-based Streaming ASR	Apr 26, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hearing Lips: Improving Lip Reading by Distilling Speech Recognizers	Nov 26, 2019	Knowledge DistillationLipreading	—Unverified
Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models	Sep 17, 2024	Audio captioningInstruction Following	—Unverified
Hearings and mishearings: decrypting the spoken word	Sep 1, 2020	Speech Recognition	—Unverified
Bridging the Gap Between Clean Data Training and Real-World Inference for Spoken Language Understanding	Apr 13, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hear "No Evil", See "Kenansville": Efficient and Transferable Black-Box Attacks on Speech Recognition and Voice Identification Systems	Oct 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hear No Evil: Towards Adversarial Robustness of Automatic Speech Recognition via Multi-Task Learning	Apr 5, 2022	Adversarial AttackAdversarial Robustness	—Unverified
Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap	Oct 22, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 55 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified