Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1051–1100 of 6433 papers

Title	Date	Tasks	Status
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities	Oct 11, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Full-Rank No More: Low-Rank Weight Training for Modern Speech Recognition Models	Oct 10, 2024	speech-recognitionSpeech Recognition	—Unverified
A two-stage transliteration approach to improve performance of a multilingual ASR	Oct 9, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Advocating Character Error Rate for Multilingual ASR Evaluation	Oct 9, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
The USTC-NERCSLIP Systems for the CHiME-8 MMCSG Challenge	Oct 8, 2024	speech-recognitionSpeech Recognition	—Unverified
Incorporating Talker Identity Aids With Improving Speech Recognition in Adversarial Environments	Oct 7, 2024	Speaker Identificationspeech-recognition	—Unverified
Automatic Screening for Children with Speech Disorder using Automatic Speech Recognition: Opportunities and Challenges	Oct 7, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
CR-CTC: Consistency regularization on CTC for improved speech recognition	Oct 7, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Punctuation Prediction for Polish Texts using Transformers	Oct 6, 2024	PredictionReading Comprehension	—Unverified
Casablanca: Data and Models for Multidialectal Arabic Speech Recognition	Oct 6, 2024	Arabic Speech Recognitionspeech-recognition	—Unverified
The OCON model: an old but green solution for distributable supervised classification for acoustic monitoring in smart cities	Oct 5, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
The OCON model: an old but gold solution for distributable supervised classification	Oct 5, 2024	Automatic Speech RecognitionClassification	CodeCode Available
Enhancement of Dysarthric Speech Reconstruction by Contrastive Learning	Oct 5, 2024	Contrastive Learningspeech-recognition	—Unverified
Reverb: Open-Source ASR and Diarization from Rev	Oct 4, 2024	speech-recognitionSpeech Recognition	—Unverified
Self-Powered LLM Modality Expansion for Large Speech-Text Models	Oct 4, 2024	Automatic Speech RecognitionInstruction Following	CodeCode Available
Multi-Dialect Vietnamese: Task, Dataset, Baseline Models and Challenges	Oct 4, 2024	Dialect IdentificationDiversity	CodeCode Available
Team MTS @ AutoMin 2021: An Overview of Existing Summarization Approaches and Comparison to Unsupervised Summarization Techniques	Oct 4, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
HAINAN: Fast and Accurate Transducer for Hybrid-Autoregressive ASR	Oct 3, 2024	speech-recognitionSpeech Recognition	—Unverified
Algorithms For Automatic Accentuation And Transcription Of Russian Texts In Speech Recognition Systems	Oct 3, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A Pilot Study of Applying Sequence-to-Sequence Voice Conversion to Evaluate the Intelligibility of L2 Speech Using a Native Speaker's Shadowings	Oct 3, 2024	speech-recognitionSpeech Recognition	—Unverified
Convolutional Variational Autoencoders for Spectrogram Compression in Automatic Speech Recognition	Oct 3, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Spoken Grammar Assessment Using LLM	Oct 2, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Efficient Streaming LLM for Speech Recognition	Oct 2, 2024	Decoderspeech-recognition	—Unverified
Automatic Speech Recognition for the Ika Language	Oct 1, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
End-to-End Speech Recognition with Pre-trained Masked Language Model	Oct 1, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Alignment-Free Training for Transducer-based Multi-Talker ASR	Sep 30, 2024	AllAutomatic Speech Recognition	—Unverified
Predictive Speech Recognition and End-of-Utterance Detection Towards Spoken Dialog Systems	Sep 30, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
AfriHuBERT: A self-supervised speech representation model for African languages	Sep 30, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Boosting Hybrid Autoregressive Transducer-based ASR with Internal Acoustic Model Training and Dual Blank Thresholding	Sep 30, 2024	speech-recognitionSpeech Recognition	—Unverified
Quantitative Analysis of Audio-Visual Tasks: An Information-Theoretic Perspective	Sep 29, 2024	Audio-Visual Speech RecognitionLip Reading	—Unverified
Fine-Tuning Automatic Speech Recognition for People with Parkinson's: An Effective Strategy for Enhancing Speech Technology Accessibility	Sep 29, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
CoT-ST: Enhancing LLM-based Speech Translation with Multimodal Chain-of-Thought	Sep 29, 2024	speech-recognitionSpeech Recognition	—Unverified
Efficient Long-Form Speech Recognition for General Speech In-Context Learning	Sep 29, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Advanced Clustering Techniques for Speech Signal Enhancement: A Review and Metanalysis of Fuzzy C-Means, K-Means, and Kernel Fuzzy C-Means Methods	Sep 28, 2024	ClusteringSpeech Enhancement	—Unverified
Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking	Sep 27, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models	Sep 27, 2024	Automatic Speech RecognitionMamba	—Unverified
A GEN AI Framework for Medical Note Generation	Sep 27, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Unveiling the Role of Pretraining in Direct Speech Translation	Sep 26, 2024	Automatic Speech RecognitionDecoder	—Unverified
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition	Sep 26, 2024	DecoderRobust Speech Recognition	—Unverified
Are Transformers in Pre-trained LM A Good ASR Encoder? An Empirical Study	Sep 26, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Deep CLAS: Deep Contextual Listen, Attend and Spell	Sep 26, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events	Sep 25, 2024	Audio TaggingAutomatic Speech Recognition	—Unverified
Speech Recognition Rescoring with Large Speech-Text Foundation Models	Sep 25, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
How to Connect Speech Foundation Models and Large Language Models? What Matters and What Does Not	Sep 25, 2024	Automatic Speech Recognitionspeech-recognition	—Unverified
Semi-Supervised Cognitive State Classification from Speech with Multi-View Pseudo-Labeling	Sep 25, 2024	Automatic Speech RecognitionEmotion Recognition	CodeCode Available
Weighted Cross-entropy for Low-Resource Languages in Multilingual Speech Recognition	Sep 25, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens	Sep 24, 2024	ClusteringDecoder	—Unverified
Revisiting Acoustic Features for Robust ASR	Sep 24, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs	Sep 24, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM	Sep 24, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 22 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified