Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 5901–5950 of 6433 papers

Title	Date	Tasks	Status
Deep Spiking Neural Networks for Large Vocabulary Automatic Speech Recognition	Nov 19, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
AfriHuBERT: A self-supervised speech representation model for African languages	Sep 30, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Language Modeling for Code-Switching: Evaluation, Integration of Monolingual Data, and Discriminative Training	Oct 28, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Deep Learning using Linear Support Vector Machines	Jun 2, 2013	Deep LearningGeneral Classification	CodeCode Available
Unsupervised Uncertainty Measures of Automatic Speech Recognition for Non-intrusive Speech Intelligibility Prediction	Apr 8, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Deep Learning Models in Speech Recognition: Measuring GPU Energy Consumption, Impact of Noise and Model Quantization for Edge Deployment	May 2, 2024	GPUNVIDIA Jetson Orin Nano	CodeCode Available
PIER: A Novel Metric for Evaluating What Matters in Code-Switching	Jan 16, 2025	Automatic Speech RecognitionDecoder	CodeCode Available
Effect of Attention and Self-Supervised Speech Embeddings on Non-Semantic Speech Tasks	Aug 28, 2023	Speech Recognition	CodeCode Available
Connectionist Temporal Classification: Labelling Unsegmented Sequence Data with Recurrent Neural Networks	Jul 25, 2006	speech-recognitionSpeech Recognition	CodeCode Available
Confusion2vec 2.0: Enriching Ambiguous Spoken Language Representations with Subwords	Feb 3, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks	Dec 16, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Independent and automatic evaluation of acoustic-to-articulatory inversion models	Nov 15, 2019	speech-recognitionSpeech Recognition	CodeCode Available
Deep Learning for Audio Signal Processing	Apr 30, 2019	Audio Signal ProcessingAutomatic Speech Recognition	CodeCode Available
Evaluation Phonemic Transcription of Low-Resource Tonal Languages for Language Documentation	May 1, 2018	Acoustic ModellingLanguage Modeling	CodeCode Available
Evaluation of Neural Architectures Trained with Square Loss vs Cross-Entropy in Classification Tasks	Jun 12, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
An Online Multilingual Hate speech Recognition System	Nov 23, 2020	Hate Speech Detectionspeech-recognition	CodeCode Available
Conformer-based Target-Speaker Automatic Speech Recognition for Single-Channel Audio	Aug 9, 2023	Automatic Speech Recognitionspeech-recognition	CodeCode Available
Language Technology Programme for Icelandic 2019-2023	Mar 20, 2020	Machine Translationspeech-recognition	CodeCode Available
Language-Universal Adapter Learning with Knowledge Distillation for End-to-End Multilingual Speech Recognition	Feb 28, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Blank Collapse: Compressing CTC emission for the faster decoding	Oct 31, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
The Sequence-to-Sequence Baseline for the Voice Conversion Challenge 2020: Cascading ASR and TTS	Oct 6, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
A segmental framework for fully-unsupervised large-vocabulary speech recognition	Jun 22, 2016	Language ModellingSpeech Recognition	CodeCode Available
Swiss Parliaments Corpus, an Automatically Aligned Swiss German Speech to Standard German Text Corpus	Oct 6, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Political corpus creation through automatic speech recognition on EU debates	Apr 17, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
EESEN: End-to-End Speech Recognition using Deep RNN Models and WFST-based Decoding	Jul 29, 2015	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Incremental Training of a Recurrent Neural Network Exploiting a Multi-Scale Dynamic Memory	Jun 29, 2020	speech-recognitionSpeech Recognition	CodeCode Available
Improving Voice Separation by Incorporating End-to-end Speech Recognition	Nov 29, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Improving Unsupervised Sparsespeech Acoustic Models with Categorical Reparameterization	May 29, 2020	Speech Recognition	CodeCode Available
Improving the Inclusivity of Dutch Speech Recognition by Fine-tuning Whisper on the JASMIN-CGN Corpus	Feb 24, 2025	Automatic Speech Recognition (ASR)speech-recognition	CodeCode Available
A Neural Network Architecture Combining Gated Recurrent Unit (GRU) and Support Vector Machine (SVM) for Intrusion Detection in Network Traffic Data	Sep 10, 2017	Binary ClassificationGeneral Classification	CodeCode Available
Improving speech recognition by revising gated recurrent units	Sep 29, 2017	speech-recognitionSpeech Recognition	CodeCode Available
A Unified Speaker Adaptation Approach for ASR	Oct 16, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
ASDF: A Differential Testing Framework for Automatic Speech Recognition Systems	Feb 11, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Deep Learning and Its Applications to Machine Health Monitoring: A Survey	Dec 16, 2016	Deep LearningImage Segmentation	CodeCode Available
Augmenting Librispeech with French Translations: A Multimodal Corpus for Direct Speech Translation Evaluation	Feb 9, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
A Framework for Adapting Human-Robot Interaction to Diverse User Groups	Oct 15, 2024	Action DetectionActivity Detection	CodeCode Available
Syllable-Based Sequence-to-Sequence Speech Recognition with the Transformer in Mandarin Chinese	Apr 28, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Multimodal Grounding for Sequence-to-Sequence Speech Recognition	Nov 9, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Position Prediction as an Effective Pretraining Strategy	Jul 15, 2022	PositionPrediction	CodeCode Available
Syllable Subword Tokens for Open Vocabulary Speech Recognition in Malayalam	Jan 17, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Large-Scale End-to-End Multilingual Speech Recognition and Language Identification with Multi-Task Learning	Oct 25, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Confidence Score Based Speaker Adaptation of Conformer Speech Recognition Systems	Feb 15, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Are Neural Open-Domain Dialog Systems Robust to Speech Recognition Errors in the Dialog History? An Empirical Study	Aug 18, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Scalable Factorized Hierarchical Variational Autoencoder Training	Apr 9, 2018	DisentanglementHyperparameter Optimization	CodeCode Available
Synchronous Speech Recognition and Speech-to-Text Translation with Interactive Decoding	Dec 16, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
AequeVox: Automated Fairness Testing of Speech Recognition Systems	Oct 19, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Deep Learning: A Critical Appraisal	Jan 2, 2018	Deep Learningspeech-recognition	CodeCode Available
Speech-Based Visual Question Answering	May 1, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Improving Slot Filling in Spoken Language Understanding with Joint Pointer and Attention	Jul 1, 2018	Sentenceslot-filling	CodeCode Available
Multimodal Speech Recognition for Language-Guided Embodied Agents	Feb 27, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available

Show:10 25 50

← PrevPage 119 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified