Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1801–1850 of 6433 papers

Title	Date	Tasks	Status
Development of a TV Broadcasts Speech Recognition System for Qatari Arabic	May 1, 2014	Arabic Speech RecognitionLanguage Modeling	—Unverified
Development of Automatic Speech Recognition for the Documentation of Cook Islands Māori	Jun 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Development of Hybrid Algorithm for Automatic Extraction of Multiword Expressions from Monolingual and Parallel Corpus of English and Punjabi	Dec 1, 2020	Information RetrievalMachine Translation	—Unverified
Development of Natural Language Processing Tools for Cook Islands M\=aori	Dec 1, 2018	Machine TranslationPart-Of-Speech Tagging	—Unverified
Development of Speech corpora for different Speech Recognition tasks in Malayalam language	Dec 1, 2015	speech-recognitionSpeech Recognition	—Unverified
Development of Text and Speech database for Hindi and Indian English specific to Mobile Communication environment	May 1, 2012	Language IdentificationSpeech Recognition	—Unverified
D\'eveloppement de ressources en swahili pour un syt\`eme de reconnaisance automatique de la parole (Developments of Swahili resources for an automatic speech recognition system) [in French]	Jun 1, 2012	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Device Directedness with Contextual Cues for Spoken Dialog Systems	Nov 23, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Attentive listening system with backchanneling, response generation and flexible turn-taking	Aug 1, 2017	Automatic Speech Recognition (ASR)Response Generation	—Unverified
DANCER: Entity Description Augmented Named Entity Corrector for Automatic Speech Recognition	Mar 26, 2024	Automatic Speech RecognitionLanguage Modelling	—Unverified
Damage Control During Domain Adaptation for Transducer Based Automatic Speech Recognition	Oct 6, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
DFSMN-SAN with Persistent Memory Model for Automatic Speech Recognition	Oct 28, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
DiaBiz – an Annotated Corpus of Polish Call Center Dialogs	Jun 1, 2022	speech-recognitionSpeech Recognition	—Unverified
Attentive Language Models	Nov 1, 2017	Image CaptioningMachine Translation	—Unverified
DAG-Structured Long Short-Term Memory for Semantic Compositionality	Jun 1, 2016	Machine TranslationSemantic Composition	—Unverified
Diacritic Recognition Performance in Arabic ASR	Feb 27, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Diagonal State Space Augmented Transformers for Speech Recognition	Feb 27, 2023	speech-recognitionSpeech Recognition	—Unverified
Dialect Adaptation and Data Augmentation for Low-Resource ASR: TalTech Systems for the MADASR 2023 Challenge	Oct 26, 2023	Automatic Speech RecognitionData Augmentation	—Unverified
Attentive Fusion Enhanced Audio-Visual Encoding for Transformer Based Robust Speech Recognition	Aug 6, 2020	Robust Speech Recognitionspeech-recognition	—Unverified
All-neural online source separation, counting, and diarization for meeting analysis	Feb 21, 2019	AllAutomatic Speech Recognition	—Unverified
Dialect Identification through Adversarial Learning and Knowledge Distillation on Romanian BERT	Apr 1, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Dialect-Specific Models for Automatic Speech Recognition of African American Vernacular English	Sep 1, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
AdaMER-CTC: Connectionist Temporal Classification with Adaptive Maximum Entropy Regularization for Automatic Speech Recognition	Mar 18, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Dialog-context aware end-to-end speech recognition	Aug 7, 2018	Sentencespeech-recognition	—Unverified
Dialog Generation Using Multi-Turn Reasoning Neural Networks	Jun 1, 2018	Constituency ParsingImage Captioning	—Unverified
Dialog state tracking, a machine reading approach using Memory Network	Jun 13, 2016	dialog state trackingManagement	—Unverified
Dialogue Act Classification in Domain-Independent Conversations Using a Deep Recurrent Neural Network	Dec 1, 2016	Automatic Speech Recognition (ASR)Dialogue Act Classification	—Unverified
Dialogue Act Segmentation for Vietnamese Human-Human Conversational Texts	Aug 16, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Dialogue-Based Simulation For Cultural Awareness Training	Feb 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Dialogue Management based on Multi-domain Corpus	Sep 1, 2015	Dialogue ManagementManagement	—Unverified
A Comparative Analysis of Bilingual and Trilingual Wav2Vec Models for Automatic Speech Recognition in Multilingual Oral History Archives	Jul 24, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
Dialogue Systems Can Generate Appropriate Responses without the Use of Question Marks? -- Investigation of the Effects of Question Marks on Dialogue Systems	Aug 7, 2023	Sentencespeech-recognition	—Unverified
Handling Numeric Expressions in Automatic Speech Recognition	Jul 18, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models	Jun 6, 2025	Automatic Speech Recognitionspeaker-diarization	—Unverified
Cycle-Consistent GAN Front-End to Improve ASR Robustness to Perturbed Speech	Oct 22, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Attentive Adversarial Learning for Domain-Invariant Training	Apr 28, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Cycle-consistency training for end-to-end speech recognition	Nov 2, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Differences in User Responses to a Wizard-of-Oz versus Automated System	Jun 1, 2013	Speech Recognition	—Unverified
Customizing Speech Recognition Model with Large Language Model Feedback	Jun 5, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Attention-Passing Models for Robust and Data-Efficient End-to-End Speech Translation	Apr 15, 2019	Machine Translationspeech-recognition	—Unverified
All-neural beamformer for continuous speech separation	Oct 13, 2021	AllAutomatic Speech Recognition	—Unverified
Customizing Grapheme-to-Phoneme System for Non-Trivial Transcription Problems in Bangla Language	Jun 1, 2019	speech-recognitionSpeech Recognition	—Unverified
CUSIDE: Chunking, Simulating Future Context and Decoding for Streaming ASR	Mar 31, 2022	Chunkingspeech-recognition	—Unverified
Digits micro-model for accurate and secure transactions	Feb 2, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Curvature: A signature for Action Recognition in Video Sequences	Apr 30, 2019	Action RecognitionFew-Shot Learning	—Unverified
Curriculum Pre-training for End-to-End Speech Translation	Apr 21, 2020	speech-recognitionSpeech Recognition	—Unverified
Attention-Guided Adaptation for Code-Switching Speech Recognition	Dec 14, 2023	Language Identificationspeech-recognition	—Unverified
Direct Acoustics-to-Word Models for English Conversational Speech Recognition	Mar 22, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Directed Speech Separation for Automatic Speech Recognition of Long Form Conversational Speech	Dec 10, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A Likelihood Ratio based Domain Adaptation Method for E2E Models	Jan 10, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 37 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified