Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 4701–4750 of 6433 papers

Title	Date	Tasks	Status
VideoBERT: A Joint Model for Video and Language Representation Learning	Apr 3, 2019	Action ClassificationGeneral Classification	CodeCode Available
Impact of ASR on Alzheimer's Disease Detection: All Errors are Equal, but Deletions are More Equal than Others	Apr 2, 2019	AllAlzheimer's Disease Detection	—Unverified
End-to-End Visual Speech Recognition for Small-Scale Datasets	Apr 2, 2019	General Classificationspeech-recognition	—Unverified
Unsupervised training of neural mask-based beamforming	Apr 2, 2019	speech-recognitionSpeech Recognition	—Unverified
Learning Shared Encoding Representation for End-to-End Speech Recognition Models	Mar 31, 2019	Deep AttentionGeneral Classification	—Unverified
Acoustically Grounded Word Embeddings for Improved Acoustics-to-Word Speech Recognition	Mar 29, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Modeling Acoustic-Prosodic Cues for Word Importance Prediction in Spoken Dialogues	Mar 28, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Wasserstein Dependency Measure for Representation Learning	Mar 28, 2019	Object Recognitionreinforcement-learning	—Unverified
Automatic Spelling Correction with Transformer for CTC-based End-to-End Speech Recognition	Mar 27, 2019	DecoderLanguage Modeling	—Unverified
Imperceptible, Robust, and Targeted Adversarial Examples for Automatic Speech Recognition	Mar 22, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
Unsupervised Speech Enhancement Based on Multichannel NMF-Informed Beamforming for Noise-Robust Automatic Speech Recognition	Mar 22, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Evaluating Sequence-to-Sequence Models for Handwritten Text Recognition	Mar 18, 2019	DecoderHandwritten Text Recognition	CodeCode Available
Audio De-identification: A New Entity Recognition Task	Mar 17, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Automatic assessment of spoken language proficiency of non-native children	Mar 15, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Audiovisual Speaker Tracking using Nonlinear Dynamical Systems with Dynamic Stream Weights	Mar 14, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available
End-To-End Speech Recognition Using A High Rank LSTM-CTC Based Model	Mar 12, 2019	Data Augmentationspeech-recognition	CodeCode Available
Bootstrapping Method for Developing Part-of-Speech Tagged Corpus in Low Resource Languages Tagset - A Focus on an African Igbo	Mar 12, 2019	Machine TranslationPOS	—Unverified
Accelerating Minibatch Stochastic Gradient Descent using Typicality Sampling	Mar 11, 2019	Reinforcement LearningReinforcement Learning (RL)	—Unverified
Singing voice conversion with non-parallel data	Mar 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Bridging the Gap Between Monaural Speech Enhancement and Recognition with Distortion-Independent Acoustic Modeling	Mar 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
The Virtual Doctor: An Interactive Artificial Intelligence based on Deep Learning for Non-Invasive Prediction of Diabetes	Mar 9, 2019	Prognosisspeech-recognition	—Unverified
Active and Semi-Supervised Learning in ASR: Benefits on the Acoustic and Language Models	Mar 7, 2019	Active Learningspeech-recognition	—Unverified
Speech Recognition with no speech or with noisy speech	Mar 2, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
KT-Speech-Crawler: Automatic Dataset Construction for Speech Recognition from YouTube Videos	Mar 1, 2019	speech-recognitionSpeech Recognition	CodeCode Available
Context-aware Neural-based Dialog Act Classification on Automatically Generated Transcriptions	Feb 28, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Incorporating End-to-End Speech Recognition Models for Sentiment Analysis	Feb 28, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
All-neural online source separation, counting, and diarization for meeting analysis	Feb 21, 2019	AllAutomatic Speech Recognition	—Unverified
The NIGENS General Sound Events Database	Feb 21, 2019	Event DetectionSound Event Detection	—Unverified
Learning with Inadequate and Incorrect Supervision	Feb 20, 2019	image-classificationImage Classification	—Unverified
Audio-Linguistic Embeddings for Spoken Sentences	Feb 20, 2019	DecoderEmotion Recognition	CodeCode Available
A spelling correction model for end-to-end speech recognition	Feb 19, 2019	Language ModelingLanguage Modelling	—Unverified
Learned In Speech Recognition: Contextual Acoustic Word Embeddings	Feb 18, 2019	Sentencespeech-recognition	—Unverified
Self-Attention Aligner: A Latency-Control End-to-End Model for ASR Using Self-Attention Network and Chunk-Hopping	Feb 18, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Enhanced Robot Speech Recognition Using Biomimetic Binaural Sound Source Localization	Feb 13, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Towards a Robust Deep Neural Network in Texts: A Survey	Feb 12, 2019	General Classificationimage-classification	—Unverified
Deep learning and face recognition: the state of the art	Feb 10, 2019	Deep LearningFace Recognition	—Unverified
End-to-end Anchored Speech Recognition	Feb 6, 2019	DecoderMulti-Task Learning	—Unverified
On the Choice of Modeling Unit for Sequence-to-Sequence Speech Recognition	Feb 5, 2019	DecoderLanguage Modeling	CodeCode Available
Using multi-task learning to improve the performance of acoustic-to-word and conventional hybrid models	Feb 2, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Hardware-Guided Symbiotic Training for Compact, Accurate, yet Execution-Efficient LSTM	Jan 30, 2019	Language ModelingLanguage Modelling	—Unverified
Harnessing GANs for Zero-shot Learning of New Classes in Visual Speech Recognition	Jan 29, 2019	speech-recognitionSpeech Recognition	CodeCode Available
A Convolutional Neural Network model based on Neutrosophy for Noisy Speech Recognition	Jan 27, 2019	General ClassificationNoisy Speech Recognition	—Unverified
Progressive Label Distillation: Learning Input-Efficient Deep Neural Networks	Jan 26, 2019	Knowledge Distillationspeech-recognition	—Unverified
Discovery of Important Subsequences in Electrocardiogram Beats Using the Nearest Neighbour Algorithm	Jan 26, 2019	ClassificationDynamic Time Warping	—Unverified
Weighted-Sampling Audio Adversarial Example Attack	Jan 26, 2019	Adversarial AttackAutomatic Speech Recognition	—Unverified
Self-Attention Networks for Connectionist Temporal Classification in Speech Recognition	Jan 22, 2019	ClassificationDecoder	CodeCode Available
Overfitting Mechanism and Avoidance in Deep Neural Networks	Jan 19, 2019	General ClassificationObject Recognition	—Unverified
Predicting Performance using Approximate State Space Model for Liquid State Machines	Jan 18, 2019	speech-recognitionSpeech Recognition	—Unverified
A Survey of the Recent Architectures of Deep Convolutional Neural Networks	Jan 17, 2019	image-classificationImage Classification	—Unverified
Phoneme-Based Persian Speech Recognition	Jan 15, 2019	speech-recognitionSpeech Recognition	—Unverified

Show:10 25 50

← PrevPage 95 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified