Automatic Speech Recognition (ASR)

Automatic Speech Recognition (ASR) involves converting spoken language into written text. It is designed to transcribe spoken words into text in real-time, allowing people to communicate with computers, mobile devices, and other technology using their voice. The goal of Automatic Speech Recognition is to accurately transcribe speech, taking into account variations in accent, pronunciation, and speaking style, as well as background noise and other factors that can affect speech quality.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 751–800 of 3012 papers

Title	Date	Tasks	Status
Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens	Feb 3, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Streaming Sequence Transduction through Dynamic Compression	Feb 2, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Whispering in Norwegian: Navigating Orthographic and Dialectic Challenges	Feb 2, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
AccentFold: A Journey through African Accents for Zero-Shot ASR Adaptation to Target Accents	Feb 2, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Digits micro-model for accurate and secure transactions	Feb 2, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Byte Pair Encoding Is All You Need For Automatic Bengali Speech Recognition	Jan 28, 2024	AllAutomatic Speech Recognition	—Unverified
Toward Practical Automatic Speech Recognition and Post-Processing: a Call for Explainable Error Benchmark Guideline	Jan 26, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction	Jan 24, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Locality enhanced dynamic biasing and sampling strategies for contextual ASR	Jan 23, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Keep Decoding Parallel with Effective Knowledge Distillation from Language Models to End-to-end Speech Recognisers	Jan 22, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Consistency Based Unsupervised Self-training For ASR Personalisation	Jan 22, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Using Large Language Model for End-to-End Chinese ASR and NER	Jan 21, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Contextualized Automatic Speech Recognition with Attention-Based Bias Phrase Boosted Beam Search	Jan 19, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition	Jan 18, 2024	Audio-Visual Speech RecognitionAutomatic Speech Recognition	—Unverified
Communication-Efficient Personalized Federated Learning for Speech-to-Text Tasks	Jan 18, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
AGADIR: Towards Array-Geometry Agnostic Directional Speech Recognition	Jan 18, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improving ASR Contextual Biasing with Guided Attention	Jan 16, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Cascaded Cross-Modal Transformer for Audio-Textual Classification	Jan 15, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Promptformer: Prompted Conformer Transducer for ASR	Jan 14, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Joint Unsupervised and Supervised Training for Automatic Speech Recognition via Bilevel Optimization	Jan 13, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Transcending Controlled Environments Assessing the Transferability of ASRRobust NLU Models to Real-World Applications	Jan 12, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese	Jan 12, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
UCorrect: An Unsupervised Framework for Automatic Speech Recognition Error Correction	Jan 11, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
End to end Hindi to English speech conversion using Bark, mBART and a finetuned XLSR Wav2Vec2	Jan 11, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Useful Blunders: Can Automated Speech Recognition Errors Improve Downstream Dementia Classification?	Jan 10, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Continuously Learning New Words in Automatic Speech Recognition	Jan 9, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR	Jan 8, 2024	Acoustic Unit DiscoveryAutomatic Speech Recognition	—Unverified
Exploratory Evaluation of Speech Content Masking	Jan 8, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
BS-PLCNet: Band-split Packet Loss Concealment Network with Multi-task Learning Framework and Multi-discriminators	Jan 8, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
High-precision Voice Search Query Correction via Retrievable Speech-text Embedings	Jan 8, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge	Jan 7, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Multichannel AV-wav2vec2: A Framework for Learning Multichannel Multi-Modal Speech Representation	Jan 7, 2024	Audio-Visual Speech RecognitionAutomatic Speech Recognition	CodeCode Available
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition	Jan 7, 2024	Audio-Visual Speech RecognitionAutomatic Speech Recognition	—Unverified
TeLeS: Temporal Lexeme Similarity Score to Estimate Confidence in End-to-End ASR	Jan 6, 2024	Active LearningAutomatic Speech Recognition	CodeCode Available
Task Oriented Dialogue as a Catalyst for Self-Supervised Automatic Speech Recognition	Jan 4, 2024	AttributeAutomatic Speech Recognition	CodeCode Available
Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models	Jan 3, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Towards Probing Contact Center Large Language Models	Dec 26, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Exploring data augmentation in bias mitigation against non-native-accented speech	Dec 24, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification	Dec 22, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
BLSTM-Based Confidence Estimation for End-to-End Speech Recognition	Dec 22, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Lattice Rescoring Based on Large Ensemble of Complementary Neural Language Models	Dec 20, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Stable Distillation: Regularizing Continued Pre-training for Low-Resource Automatic Speech Recognition	Dec 20, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
SpokesBiz -- an Open Corpus of Conversational Polish	Dec 19, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Conformer-Based Speech Recognition On Extreme Edge-Computing Devices	Dec 16, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Seq2seq for Automatic Paraphasia Detection in Aphasic Speech	Dec 16, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
OAVA: the open audio-visual archives aggregator	Dec 16, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
LiteVSR: Efficient Visual Speech Recognition by Learning from Speech Representations of Unlabeled Data	Dec 15, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
FastInject: Injecting Unpaired Text Data into CTC-based ASR training	Dec 14, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models	Dec 13, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
ROSE: A Recognition-Oriented Speech Enhancement Framework in Air Traffic Control Using Multi-Objective Learning	Dec 11, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available

Show:10 25 50

← PrevPage 16 of 61Next →

All datasets LRS2 RealMAN Sagalee HUI speech corpus LRS3-TED M-AILabs speech dataset The Spoken Wikipedia Corpora Voxforge German VoxPopuli

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	TM-CTC	Test WER	10.1	—	Unverified
2	TM-seq2seq	Test WER	9.7	—	Unverified
3	CTC/attention	Test WER	8.2	—	Unverified
4	LF-MMI TDNN	Test WER	6.7	—	Unverified
5	Whisper-LLaMA	Test WER	6.6	—	Unverified
6	End2end Conformer	Test WER	3.9	—	Unverified
7	End2end Conformer	Test WER	3.7	—	Unverified
8	MoCo + wav2vec (w/o extLM)	Test WER	2.7	—	Unverified
9	CTC/Attention	Test WER	1.5	—	Unverified
10	Whisper	Test WER	1.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	SpatialNet	CER	14.5	—	Unverified
2	CleanMel-L-mask	CER	14.4	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Conformer	Test WER	15.32	—	Unverified
2	Whisper-largev3-finetuned	Test WER	10.82	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Conformer Transducer	WER (%)	1.89	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	DistillAV	WER	1.4	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Conformer Transducer	WER (%)	4.28	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Conformer Transducer	WER (%)	8.04	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Conformer Transducer	WER (%)	3.36	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Conformer Transducer (German)	WER (%)	8.98	—	Unverified