Speech Recognition

Speech Recognition is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.

( Image credit: SpecAugment )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 3601–3650 of 6433 papers

Title	Date	Tasks	Status
Phone Based Keyword Spotting for Transcribing Very Low Resource Languages	Dec 1, 2021	Dynamic Time WarpingKeyword Spotting	—Unverified
Phoneme-aware Encoding for Prefix-tree-based Contextual ASR	Dec 15, 2023	speech-recognitionSpeech Recognition	—Unverified
Phoneme-Based Contextualization for Cross-Lingual Speech Recognition in End-to-End Models	Jun 21, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phoneme Based Neural Transducer for Large Vocabulary Speech Recognition	Oct 30, 2020	Language ModelingLanguage Modelling	—Unverified
Phoneme-Based Persian Speech Recognition	Jan 15, 2019	speech-recognitionSpeech Recognition	—Unverified
Phoneme Recognition through Fine Tuning of Phonetic Representations: a Case Study on Luhya Language Varieties	Apr 4, 2021	Phoneme Recognitionspeech-recognition	—Unverified
Phoneme Recognition with Large Hierarchical Reservoirs	Dec 1, 2010	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phone Merging For Code-Switched Speech Recognition	Jul 1, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phoneme Set Design Using English Speech Database by Japanese for Dialogue-Based English CALL Systems	May 1, 2014	Language ModellingSpeech Recognition	—Unverified
Phoneme transcription of endangered languages: an evaluation of recent ASR architectures in the single speaker scenario	May 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonemic and Graphemic Multilingual CTC Based Speech Recognition	Nov 13, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonemic Representation and Transcription for Speech to Text Applications for Under-resourced Indigenous African Languages: The Case of Kiswahili	Oct 29, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonemic Transcription of Low-Resource Languages: To What Extent can Preprocessing be Automated?	May 1, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonetically Balanced Code-Mixed Speech Corpus for Hindi-English Automatic Speech Recognition	May 1, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonetic and Graphemic Systems for Multi-Genre Broadcast Transcription	Feb 1, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonetic-assisted Multi-Target Units Modeling for Improving Conformer-Transducer ASR system	Nov 3, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Phonetic-aware speaker embedding for far-field speaker verification	Nov 27, 2023	Speaker RecognitionSpeaker Verification	—Unverified
Phonologically Informed Edit Distance Algorithms for Word Alignment with Low-Resource Languages	Jan 1, 2018	Machine TranslationSpeech Recognition	—Unverified
Phonological Pun-derstanding	Jun 1, 2016	Automatic Speech Recognition (ASR)Speech Recognition	—Unverified
Phrase Based Language Model for Statistical Machine Translation: Empirical Study	Jan 21, 2015	Language ModelingLanguage Modelling	—Unverified
Phrase Based Language Model For Statistical Machine Translation	Jan 18, 2015	Language ModelingLanguage Modelling	—Unverified
Phrase Model Training for Statistical Machine Translation with Word Lattices of Preprocessing Alternatives	Jun 1, 2012	Chinese Word SegmentationMachine Translation	—Unverified
PickNet: Real-Time Channel Selection for Ad Hoc Microphone Arrays	Jan 24, 2022	channel selectionspeech-recognition	—Unverified
Piecewise convexity of artificial neural networks	Jul 17, 2016	global-optimizationspeech-recognition	—Unverified
Pitch-Aware RNN-T for Mandarin Chinese Mispronunciation Detection and Diagnosis	Jun 7, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
PI-Whisper: Designing an Adaptive and Incremental Automatic Speech Recognition System for Edge Devices	Jun 21, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
PizzaPal: Conversational Pizza Ordering using a High-Density Conversational AI Platform	Nov 1, 2018	dialog state trackingSpeech Recognition	—Unverified
Plant Species Classification Using Transfer Learning by Pretrained Classifier VGG-19	Sep 7, 2022	ClassificationImage Augmentation	—Unverified
pMCT: Patched Multi-Condition Training for Robust Speech Recognition	Jul 11, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
PM-MMUT: Boosted Phone-Mask Data Augmentation using Multi-Modeling Unit Training for Phonetic-Reduction-Robust E2E Speech Recognition	Dec 13, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
PMMTalk: Speech-Driven 3D Facial Animation from Complementary Pseudo Multi-modal Features	Dec 5, 2023	cross-modal alignmentDecoder	—Unverified
PoCaP Corpus: A Multimodal Dataset for Smart Operating Room Speech Assistant using Interventional Radiology Workflow Analysis	Jun 24, 2022	speech-recognitionSpeech Recognition	—Unverified
Policy Learning for Domain Selection in an Extensible Multi-domain Spoken Dialogue System	Oct 1, 2014	Decision MakingDialogue Management	—Unverified
Polyphonic pitch detection with convolutional recurrent neural networks	Feb 4, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
PolySpeech: Exploring Unified Multitask Speech Models for Competitiveness with Single-task Models	Jun 12, 2024	Language ModelingLanguage Modelling	—Unverified
POMDP-based dialogue manager adaptation to extended domains	Aug 1, 2013	Dialogue ManagementSpeech Recognition	—Unverified
Population Based Training for Data Augmentation and Regularization in Speech Recognition	Oct 8, 2020	Data Augmentationspeech-recognition	—Unverified
Portable Speech-to-Speech Translation on an Android Smartphone: The MFLTS System	Mar 1, 2018	Speech RecognitionSpeech-to-Speech Translation	—Unverified
Positional Description for Numerical Normalization	Aug 22, 2024	speech-recognitionSpeech Recognition	—Unverified
Position-Invariant Truecasing with a Word-and-Character Hierarchical Recurrent Neural Network	Aug 26, 2021	Language ModelingLanguage Modelling	—Unverified
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview	Mar 1, 2024	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Post-Stroke Speech Transcription Challenge (Task B): Correctness Detection in Anomia Diagnosis with Imperfect Transcripts	Jun 1, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
power-law nonlinearity with maximally uniform distribution criterion for improved neural network training in automatic speech recognition	Dec 22, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
PP-MeT: a Real-world Personalized Prompt based Meeting Transcription System	Sep 28, 2023	Action DetectionActivity Detection	—Unverified
Practical Application of Domain Dependent Confidence Measurement for Spoken Language Understanding Systems	Jun 1, 2018	Automatic Speech Recognition (ASR)Feature Engineering	—Unverified
Practical Speech Recognition with HTK	Aug 6, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Practice of the conformer enhanced AUDIO-VISUAL HUBERT on Mandarin and English	Feb 28, 2023	Automatic Speech Recognitionspeech-recognition	—Unverified
Precise Detection of Speech Endpoints Dynamically: A Wavelet Convolution based approach	Apr 17, 2018	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Pre-Computable Multi-Layer Neural Network Language Models	Sep 1, 2015	Language ModellingMachine Translation	—Unverified
Predicting Causes of Reformulation in Intelligent Assistants	Jul 13, 2017	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 73 of 129Next →

All datasets LibriSpeech test-clean LibriSpeech test-other Switchboard + Hub500 TIMIT AISHELL-1 WSJ eval92 Common Voice German swb_hub_500 WER fullSWBCH TUDA Common Voice French Common Voice Spanish MediaSpeech

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AmNet	Word Error Rate (WER)	8.6	—	Unverified
2	HMM-(SAT)GMM	Word Error Rate (WER)	8	—	Unverified
3	Local Prior Matching (Large Model)	Word Error Rate (WER)	7.19	—	Unverified
4	Snips	Word Error Rate (WER)	6.4	—	Unverified
5	Li-GRU	Word Error Rate (WER)	6.2	—	Unverified
6	HMM-DNN + pNorm*	Word Error Rate (WER)	5.5	—	Unverified
7	CTC + policy learning	Word Error Rate (WER)	5.42	—	Unverified
8	Deep Speech 2	Word Error Rate (WER)	5.33	—	Unverified
9	HMM-TDNN + iVectors	Word Error Rate (WER)	4.8	—	Unverified
10	Gated ConvNets	Word Error Rate (WER)	4.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Local Prior Matching (Large Model)	Word Error Rate (WER)	20.84	—	Unverified
2	Snips	Word Error Rate (WER)	16.5	—	Unverified
3	Local Prior Matching (Large Model, ConvLM LM)	Word Error Rate (WER)	15.28	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	13.25	—	Unverified
5	TDNN + pNorm + speed up/down speech	Word Error Rate (WER)	12.5	—	Unverified
6	CTC-CRF 4gram-LM	Word Error Rate (WER)	10.65	—	Unverified
7	Convolutional Speech Recognition	Word Error Rate (WER)	10.47	—	Unverified
8	MT4SSL	Word Error Rate (WER)	9.6	—	Unverified
9	Jasper DR 10x5	Word Error Rate (WER)	8.79	—	Unverified
10	Espresso	Word Error Rate (WER)	8.7	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Deep Speech	Percentage error	20	—	Unverified
2	DNN-HMM	Percentage error	18.5	—	Unverified
3	CD-DNN	Percentage error	16.1	—	Unverified
4	DNN	Percentage error	16	—	Unverified
5	DNN + Dropout	Percentage error	15	—	Unverified
6	DNN BMMI	Percentage error	12.9	—	Unverified
7	DNN MPE	Percentage error	12.9	—	Unverified
8	DNN MMI	Percentage error	12.9	—	Unverified
9	HMM-TDNN + pNorm + speed up/down speech	Percentage error	12.9	—	Unverified
10	HMM-DNN +sMBR	Percentage error	12.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSNN	Percentage error	33.2	—	Unverified
2	LAS multitask with indicators sampling	Percentage error	20.4	—	Unverified
3	Soft Monotonic Attention (ours, offline)	Percentage error	20.1	—	Unverified
4	QCNN-10L-256FM	Percentage error	19.64	—	Unverified
5	Bi-LSTM + skip connections w/ CTC	Percentage error	17.7	—	Unverified
6	Bi-RNN + Attention	Percentage error	17.6	—	Unverified
7	RNN-CRF on 24(x3) MFSC	Percentage error	17.3	—	Unverified
8	CNN in time and frequency + dropout, 17.6% w/o dropout	Percentage error	16.7	—	Unverified
9	Light Gated Recurrent Units	Percentage error	16.7	—	Unverified
10	GRU	Percentage error	16.6	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Att	Word Error Rate (WER)	18.7	—	Unverified
2	CTC/Att	Word Error Rate (WER)	6.7	—	Unverified
3	BRA-E	Word Error Rate (WER)	6.63	—	Unverified
4	CTC-CRF 4gram-LM	Word Error Rate (WER)	6.34	—	Unverified
5	BAT	Word Error Rate (WER)	4.97	—	Unverified
6	Paraformer	Word Error Rate (WER)	4.95	—	Unverified
7	U2	Word Error Rate (WER)	4.72	—	Unverified
8	UMA	Word Error Rate (WER)	4.7	—	Unverified
9	Lightweight Transducer	Word Error Rate (WER)	4.31	—	Unverified
10	CIF-HKD With LM	Word Error Rate (WER)	4.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Jasper 10x3	Word Error Rate (WER)	6.9	—	Unverified
2	CNN over RAW speech (wav)	Word Error Rate (WER)	5.6	—	Unverified
3	CTC-CRF 4gram-LM	Word Error Rate (WER)	3.79	—	Unverified
4	Deep Speech 2	Word Error Rate (WER)	3.6	—	Unverified
5	test-set on open vocabulary (i.e. harder), model = HMM-DNN + pNorm*	Word Error Rate (WER)	3.6	—	Unverified
6	Convolutional Speech Recognition	Word Error Rate (WER)	3.5	—	Unverified
7	TC-DNN-BLSTM-DNN	Word Error Rate (WER)	3.5	—	Unverified
8	Espresso	Word Error Rate (WER)	3.4	—	Unverified
9	CTC-CRF VGG-BLSTM	Word Error Rate (WER)	3.2	—	Unverified
10	Transformer with Relaxed Attention	Word Error Rate (WER)	3.19	—	Unverified