Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2701–2750 of 6433 papers

Title	Date	Tasks	Status
FAT: Training Neural Networks for Reliable Inference Under Hardware Faults	Nov 11, 2020	image-classificationImage Classification	—Unverified
Arabic Language WEKA-Based Dialect Classifier for Arabic Automatic Speech Recognition Transcripts	Dec 1, 2016	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Adversarial Speech Generation and Natural Speech Recovery for Speech Content Protection	Jun 1, 2022	speech-recognitionSpeech Recognition	—Unverified
Grammar Based Speaker Role Identification for Air Traffic Control Speech Recognition	Aug 27, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Grammatical vs Spelling Error Correction: An Investigation into the Responsiveness of Transformer-based Language Models using BART and MarianMT	Mar 25, 2024	Optical Character Recognition (OCR)speech-recognition	—Unverified
Granary: Speech Recognition and Translation Dataset in 25 European Languages	May 19, 2025	HallucinationPunctuation Restoration	—Unverified
Fast Word Error Rate Estimation Using Self-Supervised Representations for Speech and Text	Oct 12, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Churn Identification in Microblogs using Convolutional Neural Networks with Structured Logical Knowledge	Sep 1, 2017	Language ModelingLanguage Modelling	—Unverified
Fast Text-Only Domain Adaptation of RNN-Transducer Prediction Network	Apr 22, 2021	Domain AdaptationLanguage Modeling	—Unverified
Graph Meets LLM: A Novel Approach to Collaborative Filtering for Robust Conversational Understanding	May 23, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Fast Syntactic Analysis for Statistical Language Modeling via Substructure Sharing and Uptraining	Jul 1, 2012	Language ModelingLanguage Modelling	—Unverified
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition	Sep 15, 2023	DecoderForm	—Unverified
GRASS: the Graz corpus of Read And Spontaneous Speech	May 1, 2014	Speech Recognition	—Unverified
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper	Sep 20, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Grouping Language Model Boundary Words to Speed K--Best Extraction from Hypergraphs	Jun 1, 2013	Language ModelingLanguage Modelling	—Unverified
Grow and Prune Compact, Fast, and Accurate LSTMs	May 30, 2018	Image Captioningspeech-recognition	—Unverified
Fast Spectrogram Inversion using Multi-head Convolutional Neural Networks	Aug 20, 2018	speech-recognitionSpeech Recognition	—Unverified
Guided contrastive self-supervised pre-training for automatic speech recognition	Oct 22, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Faster, Simpler and More Accurate Hybrid ASR Systems Using Wordpieces	May 19, 2020	Speech Recognition	—Unverified
Guided-TTS: A Diffusion Model for Text-to-Speech via Classifier Guidance	Nov 23, 2021	speech-recognitionSpeech Recognition	—Unverified
Guiding CTC Posterior Spike Timings for Improved Posterior Fusion and Knowledge Distillation	Apr 17, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
CHISPA on the GO: A mobile Chinese-Spanish translation service for travellers in trouble	Apr 1, 2014	Image RetrievalInformation Retrieval	—Unverified
Arabic Dialect Processing Tutorial	Jun 1, 2012	Machine TranslationSpeech Recognition	—Unverified
Hallucination of speech recognition errors with sequence to sequence learning	Mar 23, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models	Jan 3, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Halving transcription time: A fast, user-friendly and GDPR-compliant workflow to create AI-assisted transcripts for content analysis	Mar 17, 2025	Automatic Speech Recognitionspeech-recognition	—Unverified
Adversarial Speaker Disentanglement Using Unannotated External Data for Self-supervised Representation Based Voice Conversion	May 16, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Handwriting recognition for Scottish Gaelic	Jun 1, 2022	Handwriting Recognitionspeech-recognition	—Unverified
A cost minimization approach to fix the vocabulary size in a tokenizer for an End-to-End ASR system	Apr 29, 2024	speech-recognitionSpeech Recognition	—Unverified
Hard Sample Mining for the Improved Retraining of Automatic Speech Recognition	Apr 17, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Accented Speech Recognition Inspired by Human Perception	Apr 9, 2021	Accented Speech RecognitionAutomatic Speech Recognition	—Unverified
Fast, simple and accurate handwritten digit classification by training shallow neural network classifiers with the 'extreme learning machine' algorithm	Dec 29, 2014	General Classificationspeech-recognition	—Unverified
Chipmunk: A Systolically Scalable 0.9 mm^2, 3.08 Gop/s/mW @ 1.2 mW Accelerator for Near-Sensor Recurrent Neural Network Inference	Nov 15, 2017	speech-recognitionSpeech Recognition	—Unverified
Fast Real-time Personalized Speech Enhancement: End-to-End Enhancement Network (E3Net) and Knowledge Distillation	Apr 2, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
HARK Side of Deep Learning -- From Grad Student Descent to Automated Machine Learning	Apr 16, 2019	BIG-bench Machine LearningDecision Making	—Unverified
Fast offline Transformer-based end-to-end automatic speech recognition for real-world applications	Jan 14, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Chinese Medical Speech Recognition with Punctuated Hypothesis	Oct 1, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Arabic Diacritization with Recurrent Neural Networks	Sep 1, 2015	Language ModellingMorphological Analysis	—Unverified
Harnessing Transfer Learning from Swahili: Advancing Solutions for Comorian Dialects	Dec 9, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
HASP: A High-Performance Adaptive Mobile Security Enhancement Against Malicious Speech Recognition	Sep 4, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
HausaNLP: Current Status, Challenges and Future Directions for Hausa Natural Language Processing	May 20, 2025	Language ModelingLanguage Modelling	—Unverified
Have best of both worlds: two-pass hybrid and E2E cascading framework for speech recognition	Oct 10, 2021	speech-recognitionSpeech Recognition	—Unverified
Head-synchronous Decoding for Transformer-based Streaming ASR	Apr 26, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hearing Lips: Improving Lip Reading by Distilling Speech Recognizers	Nov 26, 2019	Knowledge DistillationLipreading	—Unverified
Fast Node Embeddings: Learning Ego-Centric Representations	Jan 1, 2018	Link PredictionMachine Translation	—Unverified
Hearings and mishearings: decrypting the spoken word	Sep 1, 2020	Speech Recognition	—Unverified
Chinese-LiPS: A Chinese audio-visual speech recognition dataset with Lip-reading and Presentation Slides	Apr 21, 2025	Audio-Visual Speech RecognitionAutomatic Speech Recognition	—Unverified
Hear "No Evil", See "Kenansville": Efficient and Transferable Black-Box Attacks on Speech Recognition and Voice Identification Systems	Oct 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hear No Evil: Towards Adversarial Robustness of Automatic Speech Recognition via Multi-Task Learning	Apr 5, 2022	Adversarial AttackAdversarial Robustness	—Unverified
Fast Labeling and Transcription with the Speechalyzer Toolkit	May 1, 2012	Audio ClassificationBenchmarking	—Unverified

Show:10 25 50

← PrevPage 55 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified