Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 4201–4250 of 6433 papers

Title	Date	Tasks	Status
Research on Modeling Units of Transformer Transducer for Mandarin Speech Recognition	Apr 26, 2020	speech-recognitionSpeech Recognition	—Unverified
Jointly Trained Transformers models for Spoken Language Translation	Apr 25, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Adversarial Machine Learning in Network Intrusion Detection Systems	Apr 23, 2020	BIG-bench Machine LearningIntrusion Detection	—Unverified
End-to-end speech-to-dialog-act recognition	Apr 23, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Cloud-Based Face and Speech Recognition for Access Control Applications	Apr 23, 2020	Face Recognitionspeech-recognition	—Unverified
A Study of Non-autoregressive Model for Sequence Generation	Apr 22, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Towards a Competitive End-to-End Speech Recognition for CHiME-6 Dinner Party Transcription	Apr 22, 2020	Data AugmentationSpeech Enhancement	CodeCode Available
Curriculum Pre-training for End-to-End Speech Translation	Apr 21, 2020	speech-recognitionSpeech Recognition	—Unverified
ESPnet-ST: All-in-One Speech Translation Toolkit	Apr 21, 2020	AllAutomatic Speech Recognition	—Unverified
CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings	Apr 20, 2020	speaker-diarizationSpeaker Diarization	—Unverified
End-to-End Whisper to Natural Speech Conversion using Modified Transformer Network	Apr 20, 2020	DecoderSpeech Recognition	—Unverified
Language-agnostic Multilingual Modeling	Apr 20, 2020	speech-recognitionSpeech Recognition	—Unverified
AlloVera: A Multilingual Allophone Database	Apr 17, 2020	speech-recognitionSpeech Recognition	—Unverified
Speaker Recognition in Bengali Language from Nonlinear Features	Apr 15, 2020	Speaker IdentificationSpeaker Recognition	—Unverified
Speech Translation and the End-to-End Promise: Taking Stock of Where We Are	Apr 14, 2020	Machine Translationspeech-recognition	—Unverified
Speaker Diarization with Lexical Information	Apr 13, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Punctuation Prediction in Spontaneous Conversations: Can We Mitigate ASR Errors with Retrofitted Word Embeddings?	Apr 13, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improved Speech Representations with Multi-Target Autoregressive Predictive Coding	Apr 11, 2020	speech-recognitionSpeech Recognition	—Unverified
Minimum Latency Training Strategies for Streaming Sequence-to-Sequence ASR	Apr 10, 2020	DecoderMulti-Task Learning	—Unverified
Improving Readability for Automatic Speech Recognition Transcription	Apr 9, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Semi-supervised acoustic modelling for five-lingual code-switched ASR using automatically-segmented soap opera speech	Apr 8, 2020	Acoustic ModellingAction Detection	—Unverified
An investigation of phone-based subword units for end-to-end speech recognition	Apr 8, 2020	DecoderLanguage Modeling	—Unverified
Homophone-based Label Smoothing in End-to-End Automatic Speech Recognition	Apr 7, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Evaluating the Communication Efficiency in Federated Learning Algorithms	Apr 6, 2020	Federated Learningspeech-recognition	—Unverified
Semi-supervised acoustic and language model training for English-isiZulu code-switched speech recognition	Apr 5, 2020	Language ModelingLanguage Modelling	—Unverified
Characterizing Speech Adversarial Examples Using Self-Attention U-Net Enhancement	Mar 31, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
A Swiss German Dictionary: Variation in Speech and Writing	Mar 31, 2020	Diversityspeech-recognition	—Unverified
Serialized Output Training for End-to-End Overlapped Speech Recognition	Mar 28, 2020	Decoderspeech-recognition	—Unverified
Can you hear me now? Sensitive comparisons of human and machine perception	Mar 27, 2020	Mathspeech-recognition	—Unverified
Low Latency ASR for Simultaneous Speech Translation	Mar 22, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Training for Speech Recognition on Coprocessors	Mar 22, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
High Performance Sequence-to-Sequence Model for Streaming Speech Recognition	Mar 22, 2020	speech-recognitionSpeech Recognition	—Unverified
A Joint Approach to Compound Splitting and Idiomatic Compound Detection	Mar 21, 2020	Information RetrievalMachine Translation	—Unverified
Language Technology Programme for Icelandic 2019-2023	Mar 20, 2020	Machine Translationspeech-recognition	CodeCode Available
Techniques for Vocabulary Expansion in Hybrid Speech Recognition Systems	Mar 19, 2020	graph constructionspeech-recognition	—Unverified
Deliberation Model Based Two-Pass End-to-End Speech Recognition	Mar 17, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
High-Accuracy and Low-Latency Speech Recognition with Two-Head Contextual Layer Trajectory LSTM Model	Mar 17, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
ASR Error Correction and Domain Adaptation Using Machine Translation	Mar 13, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hybrid Autoregressive Transducer (hat)	Mar 12, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Improving noise robust automatic speech recognition with single-channel time-domain enhancement network	Mar 9, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Toward Cross-Domain Speech Recognition with End-to-End Models	Mar 9, 2020	speech-recognitionSpeech Recognition	—Unverified
Deep Neural Networks for Automatic Speech Processing: A Survey from Large Corpora to Limited Data	Mar 9, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Analyzing Accuracy Loss in Randomized Smoothing Defenses	Mar 3, 2020	Autonomous DrivingBIG-bench Machine Learning	—Unverified
Improving Uyghur ASR systems with decoders using morpheme-based language models	Mar 3, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Convo: What does conversational programming need? An exploration of machine learning interface design	Mar 3, 2020	BIG-bench Machine LearningGoal-Oriented Dialog	—Unverified
Controllable Time-Delay Transformer for Real-Time Punctuation Prediction and Disfluency Detection	Mar 3, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
SkinAugment: Auto-Encoding Speaker Conversions for Automatic Speech Translation	Feb 27, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Open Set Modulation Recognition Based on Dual-Channel LSTM Model	Feb 27, 2020	speech-recognitionSpeech Recognition	—Unverified
Bridging the Gap between Spatial and Spectral Domains: A Survey on Graph Neural Networks	Feb 27, 2020	Deep Learningimage-classification	—Unverified
ParasNet: Fast Parasites Detection with Neural Networks	Feb 26, 2020	Deep LearningDrug Discovery	—Unverified

Show:10 25 50

← PrevPage 85 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified