Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 5151–5200 of 6433 papers

Title	Date	Tasks	Status
Zero-Shot Joint Modeling of Multiple Spoken-Text-Style Conversion Tasks using Switching Tokens	Jun 23, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Zero-shot Learning for Speech Recognition with Universal Phonetic Model	Sep 27, 2018	speech-recognitionSpeech Recognition	—Unverified
Zero-Shot Learning of Language Models for Describing Human Actions Based on Semantic Compositionality of Actions	Dec 1, 2014	Language ModellingMachine Translation	—Unverified
Zero-shot Speech Translation	Jul 13, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora	Sep 17, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Zipformer: A faster and better encoder for automatic speech recognition	Oct 17, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Zipper: A Multi-Tower Decoder Architecture for Fusing Modalities	May 29, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
0/1 Deep Neural Networks via Block Coordinate Descent	Jun 19, 2022	10-shot image generation	—Unverified
ZJU’s IWSLT 2021 Speech Translation System	Aug 1, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
100,000 Podcasts: A Spoken English Document Corpus	Dec 1, 2020	3D Facial Landmark LocalizationAutomatic Speech Recognition	—Unverified
11 TeraFLOPs per second photonic convolutional accelerator for deep learning optical neural networks	Nov 14, 2020	Board GamesMedical Diagnosis	—Unverified
Deep Cytometry: Deep learning with Real-time Inference in Cell Sorting and Flow Cytometry	Apr 9, 2019	Computational EfficiencyDeep Learning	—Unverified
Automatic Spelling Correction with Transformer for CTC-based End-to-End Speech Recognition	Mar 27, 2019	DecoderLanguage Modeling	—Unverified
A Novel Task-Oriented Text Corpus in Silent Speech Recognition and its Natural Language Generation Construction Method	Apr 19, 2019	Data-to-Text GenerationDiversity	—Unverified
Analysis of Deep Clustering as Preprocessing for Automatic Speech Recognition of Sparsely Overlapping Speech	May 9, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
An Efficient Pre-processing Method to Eliminate Adversarial Effects	May 15, 2019	General ClassificationImage Classification	—Unverified
Fluent Translations from Disfluent Speech in End-to-End Speech Translation	Jun 3, 2019	Machine Translationspeech-recognition	—Unverified
Listening while Speaking and Visualizing: Improving ASR through Multimodal Chain	Jun 3, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improving Minimal Gated Unit for Sequential Data	May 21, 2019	Machine Translationspeech-recognition	—Unverified
Regularization Advantages of Multilingual Neural Language Models for Low Resource Domains	May 29, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Towards Better Understanding of Spontaneous Conversations: Overcoming Automatic Speech Recognition Errors With Intent Recognition	Aug 21, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Persian Signature Verification using Fully Convolutional Networks	Sep 20, 2019	speech-recognitionSpeech Recognition	—Unverified
Improving OOV Detection and Resolution with External Language Models in Acoustic-to-Word ASR	Sep 22, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Transformer-based Cascaded Multimodal Speech Translation	Oct 29, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improving sequence-to-sequence speech recognition training with on-the-fly data augmentation	Oct 29, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
1SPU: 1-step Speech Processing Unit	Nov 8, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
2020福爾摩沙臺語語音辨識比賽之初步實驗 (A Preliminary Study of Formosa Speech Recognition Challenge 2020 – Taiwanese ASR)	Jun 1, 2021	speech-recognitionSpeech Recognition	—Unverified
Improving noisy student training for low-resource languages in End-to-End ASR using CycleGAN and inter-domain losses	Jul 26, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
ELP-Adapters: Parameter Efficient Adapter Tuning for Various Speech Processing Tasks	Jul 28, 2024	Emotion Recognitionparameter-efficient fine-tuning	—Unverified
Towards interfacing large language models with ASR systems using confidence measures and prompting	Jul 31, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition	Jul 31, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Handling Numeric Expressions in Automatic Speech Recognition	Jul 18, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Sentence-wise Speech Summarization: Task, Datasets, and End-to-End Modeling with LM Knowledge Distillation	Aug 1, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
SynesLM: A Unified Approach for Audio-visual Speech Recognition and Translation via Language Model and Synthetic Data	Aug 1, 2024	Audio-Visual Speech RecognitionAutomatic Speech Recognition	—Unverified
Self-Supervised Learning for Multi-Channel Neural Transducer	Aug 6, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval	Aug 6, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder	Sep 21, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio	May 16, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors	May 16, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
2-bit Conformer quantization for automatic speech recognition	May 26, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
2D-CTC for Scene Text Recognition	Jul 23, 2019	DecoderScene Text Recognition	—Unverified
3-D Feature and Acoustic Modeling for Far-Field Speech Recognition	Nov 13, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
3D Feature Pyramid Attention Module for Robust Visual Speech Recognition	Oct 15, 2018	LipreadingSentence	—Unverified
4-bit Quantization of LSTM-based Speech Recognition Models	Aug 27, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Joint Beam Search Integrating CTC, Attention, and Transducer Decoders	Jun 5, 2024	Automatic Speech RecognitionDecoder	—Unverified
4D ASR: Joint modeling of CTC, Attention, Transducer, and Mask-Predict decoders	Dec 21, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
使用字典學習法於強健性語音辨識 (The Use of Dictionary Learning Approach for Robustness Speech Recognition) [In Chinese]	Dec 1, 2016	Automatic Speech Recognition (ASR)Dictionary Learning	—Unverified
使用字典學習法於強健性語音辨識(The Use of Dictionary Learning Approach for Robustness Speech Recognition) [In Chinese]	Oct 1, 2016	Automatic Speech Recognition (ASR)Dictionary Learning	—Unverified
使用長短期記憶類神經網路建構中文語音辨識器之研究 (A study on Mandarin speech recognition using Long Short-Term Memory neural network) [In Chinese]	Oct 1, 2018	speech-recognitionSpeech Recognition	—Unverified
A 71.2-μW Speech Recognition Accelerator with Recurrent Spiking Neural Network	Mar 27, 2025	Quantizationspeech-recognition	—Unverified

Show:10 25 50

← PrevPage 104 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified