Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 4851–4900 of 6433 papers

Title	Date	Tasks	Status
Performance Evaluation of Deep Convolutional Maxout Neural Network in Speech Recognition	May 4, 2021	speech-recognitionSpeech Recognition	—Unverified
Performance Monitoring for End-to-End Speech Recognition	Apr 9, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Performant ASR Models for Medical Entities in Accented Speech	Jun 18, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
The Recognition Of Persian Phonemes Using PPNet	Dec 17, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Persistent Hidden States and Nonlinear Transformation for Long Short-Term Memory	Jun 22, 2018	Machine Translationspeech-recognition	—Unverified
Persistent Laplacian-enhanced Algorithm for Scarcely Labeled Data Classification	May 25, 2023	Classificationspeech-recognition	—Unverified
persoDA: Personalized Data Augmentation for Personalized ASR	Jan 15, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Personalization for BERT-based Discriminative Speech Recognition Rescoring	Jul 13, 2023	Decoderspeech-recognition	—Unverified
Personalization of CTC-based End-to-End Speech Recognition Using Pronunciation-Driven Subword Tokenization	Oct 16, 2023	Automatic Speech Recognitionspeech-recognition	—Unverified
Towards Personalization of CTC Speech Recognition Models with Contextual Adapters and Adaptive Boosting	Oct 18, 2022	Decoderspeech-recognition	—Unverified
Personalization of End-to-end Speech Recognition On Mobile Devices For Named Entities	Dec 14, 2019	speech-recognitionSpeech Recognition	—Unverified
Personalization Strategies for End-to-End Speech Recognition Systems	Feb 15, 2021	speech-recognitionSpeech Recognition	—Unverified
Personalized Adversarial Data Augmentation for Dysarthric and Elderly Speech Recognition	May 13, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Personalized Automatic Speech Recognition Trained on Small Disordered Speech Datasets	Oct 9, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Personalized Keyphrase Detection using Speaker and Environment Information	Apr 28, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Personalized Machine Translation: Predicting Translational Preferences	Sep 1, 2015	Collaborative FilteringDomain Adaptation	—Unverified
Personalized Predictive ASR for Latency Reduction in Voice Assistants	May 23, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Personalized Query Rewriting in Conversational AI Agents	Nov 9, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Personalized Speech Enhancement: New Models and Comprehensive Evaluation	Oct 18, 2021	Speech Enhancementspeech-recognition	—Unverified
Personalized Speech Recognition for Children with Test-Time Adaptation	Sep 19, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Personalized Speech recognition on mobile devices	Mar 10, 2016	DecoderLanguage Modeling	—Unverified
DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation	Oct 10, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Personal VAD 2.0: Optimizing Personal Voice Activity Detection for On-Device Speech Recognition	Apr 8, 2022	Action DetectionActivity Detection	—Unverified
PhaseFool: Phase-oriented Audio Adversarial Examples via Energy Dissipation	Sep 29, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
PhasePerturbation: Speech Data Augmentation via Phase Perturbation for Automatic Speech Recognition	Dec 13, 2023	Automatic Speech RecognitionData Augmentation	—Unverified
Phone Based Keyword Spotting for Transcribing Very Low Resource Languages	Dec 1, 2021	Dynamic Time WarpingKeyword Spotting	—Unverified
Phoneme-aware Encoding for Prefix-tree-based Contextual ASR	Dec 15, 2023	speech-recognitionSpeech Recognition	—Unverified
Phoneme-Based Contextualization for Cross-Lingual Speech Recognition in End-to-End Models	Jun 21, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phoneme Based Neural Transducer for Large Vocabulary Speech Recognition	Oct 30, 2020	Language ModelingLanguage Modelling	—Unverified
Phoneme-Based Persian Speech Recognition	Jan 15, 2019	speech-recognitionSpeech Recognition	—Unverified
Phoneme Recognition through Fine Tuning of Phonetic Representations: a Case Study on Luhya Language Varieties	Apr 4, 2021	Phoneme Recognitionspeech-recognition	—Unverified
Phoneme Recognition with Large Hierarchical Reservoirs	Dec 1, 2010	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phone Merging For Code-Switched Speech Recognition	Jul 1, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phoneme Set Design Using English Speech Database by Japanese for Dialogue-Based English CALL Systems	May 1, 2014	Language ModellingSpeech Recognition	—Unverified
Phoneme transcription of endangered languages: an evaluation of recent ASR architectures in the single speaker scenario	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonemic and Graphemic Multilingual CTC Based Speech Recognition	Nov 13, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonemic Representation and Transcription for Speech to Text Applications for Under-resourced Indigenous African Languages: The Case of Kiswahili	Oct 29, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonemic Transcription of Low-Resource Languages: To What Extent can Preprocessing be Automated?	May 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonetically Balanced Code-Mixed Speech Corpus for Hindi-English Automatic Speech Recognition	May 1, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonetic and Graphemic Systems for Multi-Genre Broadcast Transcription	Feb 1, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonetic-assisted Multi-Target Units Modeling for Improving Conformer-Transducer ASR system	Nov 3, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonetic-aware speaker embedding for far-field speaker verification	Nov 27, 2023	Speaker RecognitionSpeaker Verification	—Unverified
Phonologically Informed Edit Distance Algorithms for Word Alignment with Low-Resource Languages	Jan 1, 2018	Machine TranslationSpeech Recognition	—Unverified
Phonological Pun-derstanding	Jun 1, 2016	Automatic Speech Recognition (ASR)Speech Recognition	—Unverified
Phrase Based Language Model for Statistical Machine Translation: Empirical Study	Jan 21, 2015	Language ModelingLanguage Modelling	—Unverified
Phrase Based Language Model For Statistical Machine Translation	Jan 18, 2015	Language ModelingLanguage Modelling	—Unverified
Phrase Model Training for Statistical Machine Translation with Word Lattices of Preprocessing Alternatives	Jun 1, 2012	Chinese Word SegmentationMachine Translation	—Unverified
PickNet: Real-Time Channel Selection for Ad Hoc Microphone Arrays	Jan 24, 2022	channel selectionspeech-recognition	—Unverified
Piecewise convexity of artificial neural networks	Jul 17, 2016	global-optimizationspeech-recognition	—Unverified
Pitch-Aware RNN-T for Mandarin Chinese Mispronunciation Detection and Diagnosis	Jun 7, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 98 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified