Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1901–1950 of 6433 papers

Title	Date	Tasks	Status
Distributed Hessian-Free Optimization for Deep Neural Network	Jun 2, 2016	CPUspeech-recognition	—Unverified
Attention-based Wav2Text with Feature Transfer Learning	Sep 22, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Align, Write, Re-order: Explainable End-to-End Speech Translation via Operation Sequence Generation	Nov 11, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Distributed Training of Deep Neural Network Acoustic Models for Automatic Speech Recognition	Feb 24, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Distribution Aware Metrics for Conditional Natural Language Generation	Sep 15, 2022	Diversityspeech-recognition	—Unverified
Dive deeper: Deep Semantics for Sentiment Analysis	Jun 1, 2014	Machine TranslationNamed Entity Recognition (NER)	—Unverified
CTC Variations Through New WFST Topologies	Oct 6, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Attention-based Transducer for Online Speech Recognition	May 18, 2020	CPUDecoder	—Unverified
CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition	Feb 3, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
DNN-Based Multilingual Automatic Speech Recognition for Wolaytta using Oromo Speech	May 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
DNN-Based Semantic Model for Rescoring N-best Speech Recognition List	Nov 2, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
DNN-based uncertainty estimation for weighted DNN-HMM ASR	May 29, 2017	speech-recognitionSpeech Recognition	—Unverified
CTC Blank Triggered Dynamic Layer-Skipping for Efficient CTC-based Speech Recognition	Jan 4, 2024	Knowledge Distillationspeech-recognition	—Unverified
Attention-based sequence-to-sequence model for speech recognition: development of state-of-the-art system on LibriSpeech and its application to non-native English	Oct 31, 2018	speech-recognitionSpeech Recognition	—Unverified
Align With Purpose: Optimize Desired Properties in CTC Models with a General Plug-and-Play Framework	Jul 4, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Do End-to-End Speech Recognition Models Care About Context?	Feb 17, 2021	DecoderLanguage Modeling	—Unverified
ADAGIO: Interactive Experimentation with Adversarial Attack and Defense for Audio	May 30, 2018	Adversarial AttackAudio Compression	—Unverified
Does Single-channel Speech Enhancement Improve Keyword Spotting Accuracy? A Case Study	Sep 27, 2023	Automatic Speech RecognitionKeyword Spotting	—Unverified
CTC-Assisted LLM-Based Contextual ASR	Nov 10, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Does Visual Self-Supervision Improve Learning of Speech Representations for Emotion Recognition?	May 4, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Does Whisper understand Swiss German? An automatic, qualitative, and human evaluation	Apr 30, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
CTC Alignments Improve Autoregressive Translation	Oct 11, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Attention based on-device streaming speech recognition with large speech corpus	Jan 2, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition	Feb 26, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Domain Adaptation via Teacher-Student Learning for End-to-End Speech Recognition	Jan 6, 2020	DecoderDomain Adaptation	—Unverified
Domain Adversarial Neural Networks for Dysarthric Speech Recognition	Oct 7, 2020	Multi-Task Learningspeech-recognition	—Unverified
Domain Adversarial Training for Accented Speech Recognition	Jun 7, 2018	Accented Speech RecognitionMulti-Task Learning	—Unverified
Domain-aware Neural Language Models for Speech Recognition	Jan 5, 2021	Domain Adaptationdomain classification	—Unverified
Attention-based Neural Beamforming Layers for Multi-channel Speech Recognition	May 12, 2021	speech-recognitionSpeech Recognition	—Unverified
Domain Generalization: A Survey	Mar 3, 2021	Action RecognitionData Augmentation	—Unverified
Cross-Utterance Language Models with Acoustic Error Sampling	Aug 19, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Prompt Tuning GPT-2 language model for parameter-efficient domain adaptation of ASR systems	Dec 16, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Cross-utterance Reranking Models with BERT and Graph Convolutional Networks for Conversational Speech Recognition	Jun 13, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Cross-Modal Transformer-Based Neural Correction Models for Automatic Speech Recognition	Jul 4, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment	Oct 24, 2020	Decoderspeech-recognition	—Unverified
Don't Stop Self-Supervision: Accent Adaptation of Speech Representations via Residual Adapters	Jul 2, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Cross-Modal Mutual Learning for Cued Speech Recognition	Dec 2, 2022	speech-recognitionSpeech Recognition	—Unverified
Cross-modal Knowledge Transfer Learning as Graph Matching Based on Optimal Transport for ASR	May 19, 2025	Automatic Speech RecognitionGraph Matching	—Unverified
Cross-Modal ASR Post-Processing System for Error Correction and Utterance Rejection	Jan 10, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Do We Still Need Automatic Speech Recognition for Spoken Language Understanding?	Nov 29, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Attention based end to end Speech Recognition for Voice Search in Hindi and English	Nov 15, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Do You Listen with One or Two Microphones? A Unified ASR Model for Single and Multi-Channel Audio	Jun 4, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
DP-DyLoRA: Fine-Tuning Transformer-Based Models On-Device under Differentially Private Federated Learning using Dynamic Low-Rank Adaptation	May 10, 2024	Federated LearningNatural Language Understanding	—Unverified
DPSNN: A Differentially Private Spiking Neural Network with Temporal Enhanced Pooling	May 24, 2022	Face RecognitionImage Classification	—Unverified
DPSNN: Spiking Neural Network for Low-Latency Streaming Speech Enhancement	Aug 14, 2024	Automatic Speech RecognitionSpeech Enhancement	—Unverified
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition	Jan 23, 2025	QuantizationRepresentation Learning	—Unverified
DRAFT: A Novel Framework to Reduce Domain Shifting in Self-supervised Learning and Its Application to Children's ASR	Jun 16, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Driven Decoding for machine translation (Vers un d\'ecodage guid\'e pour la traduction automatique) [in French]	Jun 1, 2013	Machine TranslationSpeech Recognition	—Unverified
Driving ROVER with Segment-based ASR Quality Estimation	Jul 1, 2015	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Alignment Restricted Streaming Recurrent Neural Network Transducer	Nov 5, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 39 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified