Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 51–100 of 6433 papers

Title	Date	Tasks	Status	Hype
AS-ASR: A Lightweight Framework for Aphasia-Specific Automatic Speech Recognition	Jun 6, 2025	Automatic Speech Recognitionspeech-recognition	—Unverified	0
Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition	Jun 6, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Low-Resource Domain Adaptation for Speech LLMs via Text-Only Fine-Tuning	Jun 6, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Lightweight Prompt Biasing for Contextualized End-to-End ASR Systems	Jun 6, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Better Pseudo-labeling with Multi-ASR Fusion and Error Correction by SpeechLLM	Jun 5, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Customizing Speech Recognition Model with Large Language Model Feedback	Jun 5, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition	Jun 5, 2025	Audio-Visual Speech Recognitionspeech-recognition	—Unverified	0
LLM-based phoneme-to-grapheme for phoneme-based speech recognition	Jun 5, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
LESS: Large Language Model Enhanced Semi-Supervised Learning for Speech Foundational Models	Jun 5, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Improving Child Speech Recognition and Reading Mistake Detection by Using Prompts	Jun 4, 2025	Mistake Detectionspeech-recognition	—Unverified	0
Structured State Space Model Dynamics and Parametrization for Spiking Neural Networks	Jun 4, 2025	speech-recognitionSpeech Recognition	CodeCode Available	0
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR	Jun 4, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition	Jun 4, 2025	speech-recognitionSpeech Recognition	—Unverified	0
A Multi-Dialectal Dataset for German Dialect ASR and Dialect-to-Standard Speech Translation	Jun 3, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning	Jun 3, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Enhancing Lyrics Transcription on Music Mixtures with Consistency Loss	Jun 3, 2025	Automatic Lyrics TranscriptionAutomatic Speech Recognition	—Unverified	0
Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data	Jun 2, 2025	Decoderspeech-recognition	—Unverified	0
TalTech Systems for the Interspeech 2025 ML-SUPERB 2.0 Challenge	Jun 2, 2025	Language Identificationspeech-recognition	—Unverified	0
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation	Jun 2, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
DNCASR: End-to-End Training for Speaker-Attributed ASR	Jun 2, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Riemannian Time Warping: Multiple Sequence Alignment in Curved Spaces	Jun 2, 2025	Multiple Sequence Alignmentspeech-recognition	—Unverified	0
Cocktail-Party Audio-Visual Speech Recognition	Jun 2, 2025	Audio-Visual Speech Recognitionspeech-recognition	—Unverified	0
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric	Jun 2, 2025	Automatic Speech Recognitionspeech-recognition	—Unverified	0
Unsupervised Rhythm and Voice Conversion to Improve ASR on Dysarthric Speech	Jun 2, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	0
Analyzing the Importance of Blank for CTC-Based Knowledge Distillation	Jun 2, 2025	Automatic Speech RecognitionKnowledge Distillation	—Unverified	0
WCTC-Biasing: Retraining-free Contextual Biasing ASR with Wildcard CTC-based Keyword Spotting and Inter-layer Biasing	Jun 2, 2025	Keyword Spottingspeech-recognition	—Unverified	0
Enhancing Speech Instruction Understanding and Disambiguation in Robotics via Speech Prosody	Jun 1, 2025	In-Context Learningspeech-recognition	—Unverified	0
What do self-supervised speech models know about Dutch? Analyzing advantages of language-specific pre-training	Jun 1, 2025	Automatic Speech Recognitionspeech-recognition	CodeCode Available	0
GigaAM: Efficient Self-Supervised Learner for Speech Recognition	Jun 1, 2025	Automatic Speech RecognitionLanguage Modeling	CodeCode Available	4
No Audiogram: Leveraging Existing Scores for Personalized Speech Intelligibility Prediction	May 31, 2025	Predictionspeech-recognition	—Unverified	0
DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition	May 31, 2025	Automatic Speech Recognitionspeech-recognition	—Unverified	0
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems	May 31, 2025	Language ModelingLanguage Modelling	—Unverified	0
Causal Structure Discovery for Error Diagnostics of Children's ASR	May 31, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Towards Temporally Explainable Dysarthric Speech Clarity Assessment	May 31, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	0
MOPSA: Mixture of Prompt-Experts Based Speaker Adaptation for Elderly Speech Recognition	May 30, 2025	Decoderspeech-recognition	—Unverified	0
Vedavani: A Benchmark Corpus for ASR on Vedic Sanskrit Poetry	May 30, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	0
Dynamic Context-Aware Streaming Pretrained Language Model For Inverse Text Normalization	May 30, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
MSDA: Combining Pseudo-labeling and Self-Supervision for Unsupervised Domain Adaptation in ASR	May 30, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC	May 30, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Running Conventional Automatic Speech Recognition on Memristor Hardware: A Simulated Approach	May 30, 2025	Automatic Speech RecognitionQuantization	—Unverified	0
Fewer Hallucinations, More Verification: A Three-Stage LLM-Based Framework for ASR Error Correction	May 30, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
BeaverTalk: Oregon State University's IWSLT 2025 Simultaneous Speech Translation System	May 29, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	0
Prompting Whisper for Improved Verbatim Transcription and End-to-end Miscue Detection	May 29, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Contextualized Automatic Speech Recognition with Dynamic Vocabulary Prediction and Activation	May 29, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding	May 28, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Advancing Hearing Assessment: An ASR-Based Frequency-Specific Speech Test for Diagnosing Presbycusis	May 28, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition	May 28, 2025	speech-recognitionSpeech Recognition	—Unverified	0
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge	May 27, 2025	Diversityspeech-recognition	—Unverified	0
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing	May 27, 2025	speech-recognitionSpeech Recognition	—Unverified	0
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation	May 27, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0

Show:10 25 50

← PrevPage 2 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN MMI	Percentage error	12.9	—	Unverified
7	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
8	DNN BMMI	Percentage error	12.9	—	Unverified
9	DNN MPE	Percentage error	12.9	—	Unverified
10	Deep Speech + FSH	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
5	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified