Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 4351–4400 of 6433 papers

Title	Date	Tasks	Status	Hype
Analyzing the impact of speaker localization errors on speech separation for automatic speech recognition	Oct 24, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	0
An Empirical Study of Efficient ASR Rescoring with Transformers	Oct 24, 2019	Knowledge DistillationLanguage Modeling	—Unverified	0
Recognizing long-form speech using streaming end-to-end models	Oct 24, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
A Bayesian Approach to Recurrence in Neural Networks	Oct 24, 2019	speech-recognitionSpeech Recognition	—Unverified	0
ESPnet-TTS: Unified, Reproducible, and Integratable Open Source End-to-End Text-to-Speech Toolkit	Oct 24, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	0
Pre-training in Deep Reinforcement Learning for Automatic Speech Recognition	Oct 24, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Generative Pre-Training for Speech with Autoregressive Predictive Coding	Oct 23, 2019	Representation LearningSpeaker Identification	CodeCode Available	1
Analyzing ASR pretraining for low-resource speech-to-text translation	Oct 23, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Correction of Automatic Speech Recognition with Transformer Sequence-to-sequence Model	Oct 23, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
RNN based Incremental Online Spoken Language Understanding	Oct 23, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
A Transformer with Interleaved Self-attention and Convolution for Hybrid Acoustic Models	Oct 23, 2019	speech-recognitionSpeech Recognition	CodeCode Available	0
A practical two-stage training strategy for multi-stream end-to-end speech recognition	Oct 23, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Efficient Dynamic WFST Decoding for Personalized Language Models	Oct 23, 2019	DecoderLanguage Modeling	—Unverified	0
G2G: TTS-Driven Pronunciation Learning for Graphemic Hybrid ASR	Oct 22, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Robust Neural Machine Translation for Clean and Noisy Speech Transcripts	Oct 22, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
GPU-Accelerated Viterbi Exact Lattice Decoder for Batched Online and Offline Speech Recognition	Oct 22, 2019	CPUDecoder	CodeCode Available	1
Improving Transformer-based Speech Recognition Using Unsupervised Pre-training	Oct 22, 2019	speech-recognitionSpeech Recognition	CodeCode Available	1
Adversarial Example Detection by Classification for Deep Speech Recognition	Oct 22, 2019	ClassificationGeneral Classification	CodeCode Available	0
Word-level Embeddings for Cross-Task Transfer Learning in Speech Processing	Oct 22, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	0
Transformer-based Acoustic Modeling for Hybrid Speech Recognition	Oct 22, 2019	Language ModelingLanguage Modelling	—Unverified	0
AeGAN: Time-Frequency Speech Denoising via Generative Adversarial Networks	Oct 21, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Signal Combination for Language Identification	Oct 21, 2019	Language Identificationspeech-recognition	—Unverified	0
Predicting ice flow using machine learning	Oct 20, 2019	BIG-bench Machine LearningManagement	—Unverified	0
Neuro-SERKET: Development of Integrative Cognitive System through the Composition of Deep Probabilistic Generative Models	Oct 20, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Indian EmoSpeech Command Dataset: A dataset for emotion based speech recognition in the wild	Oct 18, 2019	Emotion RecognitionKeyword Spotting	CodeCode Available	0
End-to-End Speech Recognition: A review for the French Language	Oct 18, 2019	speech-recognitionSpeech Recognition	—Unverified	0
Multi-Talker MVDR Beamforming Based on Extended Complex Gaussian Mixture Model	Oct 17, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Detecting Multiple Speech Disfluencies using a Deep Residual Network with Bidirectional Long Short-Term Memory	Oct 17, 2019	General Classificationspeech-recognition	—Unverified	0
LibriVoxDeEn: A Corpus for German-to-English Speech Translation and German Speech Recognition	Oct 17, 2019	Sentencespeech-recognition	CodeCode Available	0
Transformer ASR with Contextual Block Processing	Oct 16, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Lead2Gold: Towards exploiting the full potential of noisy transcriptions for speech recognition	Oct 16, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Transfer Learning for Algorithm Recommendation	Oct 15, 2019	BIG-bench Machine Learningimage-classification	—Unverified	0
Analyzing Large Receptive Field Convolutional Networks for Distant Speech Recognition	Oct 15, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
MIMO-SPEECH: End-to-End Multi-Channel Multi-Speaker Speech Recognition	Oct 15, 2019	speech-recognitionSpeech Recognition	—Unverified	0
vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations	Oct 12, 2019	ClusteringGeneral Classification	CodeCode Available	1
A Research Platform for Multi-Robot Dialogue with Humans	Oct 12, 2019	Dialogue ManagementManagement	—Unverified	0
VAIS ASR: Building a conversational speech recognition system using language model combination	Oct 12, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Query-by-example on-device keyword spotting	Oct 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Hear "No Evil", See "Kenansville": Efficient and Transferable Black-Box Attacks on Speech Recognition and Voice Identification Systems	Oct 11, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
One-To-Many Multilingual End-to-end Speech Translation	Oct 8, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
A Case Study on Combining ASR and Visual Features for Generating Instructional Video Captions	Oct 7, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Adapting a FrameNet Semantic Parser for Spoken Language Understanding Using Adversarial Learning	Oct 7, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Distributed Learning of Deep Neural Networks using Independent Subnet Training	Oct 4, 2019	BIG-bench Machine LearningImage Classification	CodeCode Available	0
Modeling Confidence in Sequence-to-Sequence Models	Oct 4, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
SNDCNN: Self-normalizing deep CNNs with scaled exponential linear units for speech recognition	Oct 4, 2019	Inference Optimizationspeech-recognition	—Unverified	0
Neural Zero-Inflated Quality Estimation Model For Automatic Speech Recognition System	Oct 3, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
Convolutional Neural Networks for Speech Controlled Prosthetic Hands	Oct 3, 2019	speech-recognitionSpeech Recognition	—Unverified	0
From Senones to Chenones: Tied Context-Dependent Graphemes for Hybrid Speech Recognition	Oct 2, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified	0
室內遠距離語音辨識實驗(Experiments on In-House Far-Field Speech Recognition)	Oct 1, 2019	speech-recognitionSpeech Recognition	—Unverified	0
探究端對端語音辨識於發音檢測與診斷(Investigating on Computer-Assisted Pronunciation Training Leveraging End-to-End Speech Recognition Techniques)	Oct 1, 2019	speech-recognitionSpeech Recognition	—Unverified	0

Show:10 25 50

← PrevPage 88 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified