Automatic Speech Recognition (ASR)

Automatic Speech Recognition (ASR) involves converting spoken language into written text. It is designed to transcribe spoken words into text in real-time, allowing people to communicate with computers, mobile devices, and other technology using their voice. The goal of Automatic Speech Recognition is to accurately transcribe speech, taking into account variations in accent, pronunciation, and speaking style, as well as background noise and other factors that can affect speech quality.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1–10 of 3012 papers

Title	Date	Tasks	Status
NonverbalTTS: A Public English Corpus of Text-Aligned Nonverbal Vocalizations with Emotion Annotations for Text-to-Speech	Jul 17, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers	Jul 14, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Lightweight Target-Speaker-Based Overlap Transcription for Practical Streaming ASR	Jun 25, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
End-to-End Spoken Grammatical Error Correction	Jun 23, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
AI-Generated Song Detection via Lyrics Transcripts	Jun 23, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization	Jun 20, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages	Jun 20, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Automatic Speech Recognition Biases in Newcastle English: an Error Analysis	Jun 19, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios	Jun 17, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Unifying Streaming and Non-streaming Zipformer-based ASR	Jun 17, 2025	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 1 of 302Next →

All datasets LRS2 RealMAN Sagalee HUI speech corpus LRS3-TED M-AILabs speech dataset The Spoken Wikipedia Corpora Voxforge German VoxPopuli

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	Conformer Transducer	WER (%)	8.04	—	Unverified