SOTAVerified

Automatic Speech Recognition (ASR)

Automatic Speech Recognition (ASR) involves converting spoken language into written text. It is designed to transcribe spoken words into text in real-time, allowing people to communicate with computers, mobile devices, and other technology using their voice. The goal of Automatic Speech Recognition is to accurately transcribe speech, taking into account variations in accent, pronunciation, and speaking style, as well as background noise and other factors that can affect speech quality.

Papers

Showing 701–750 of 3012 papers

TitleStatusHype
Efficient Compression of Multitask Multilingual Speech Models—0
Improving Membership Inference in ASR Model Auditing with Perturbed Loss Features—0
Sequence-to-sequence models in peer-to-peer learning: A practical application—0
Does Whisper understand Swiss German? An automatic, qualitative, and human evaluation—0
Automatic Speech Recognition System-Independent Word Error Rate Estimation—0
U2++ MoE: Scaling 4.7x parameters with minimal impact on RTF—0
Killkan: The Automatic Speech Recognition Dataset for Kichwa with Morphosyntactic InformationCode0
Rethinking Processing Distortions: Disentangling the Impact of Speech Enhancement Errors on Speech Recognition Performance—0
Breaking Walls: Pioneering Automatic Speech Recognition for Central Kurdish: End-to-End Transformer Paradigm—0
Semantically Corrected Amharic Automatic Speech RecognitionCode0
Artificial Neural Networks to Recognize Speakers Division from Continuous Bengali Speech—0
Anatomy of Industrial Scale Multilingual ASR—0
Comparing Apples to Oranges: LLM-powered Multimodal Intention Prediction in an Object Categorization Task—0
Automatic Speech Recognition Advancements for Indigenous Languages of the Americas—0
An Effective Automated Speaking Assessment Approach to Mitigating Data Scarcity and Imbalanced Distribution—0
Conformer-1: Robust ASR via Large-Scale Semisupervised Bootstrapping—0
The X-LANCE Technical Report for Interspeech 2024 Speech Processing Using Discrete Speech Unit Challenge—0
Mai Ho'omāuna i ka 'Ai: Language Models Improve Automatic Speech Recognition in Hawaiian—0
Noise Masking Attacks and Defenses for Pretrained Speech Models—0
Houston we have a Divergence: A Subgroup Performance Analysis of ASR Models—0
Multi-Stage Multi-Modal Pre-Training for Automatic Speech Recognition—0
LV-CTC: Non-autoregressive ASR with CTC and latent variable models—0
ZAEBUC-Spoken: A Multilingual Multidialectal Arabic-English Speech Corpus—0
Extracting Biomedical Entities from Noisy Audio Transcripts—0
A Multimodal Approach to Device-Directed Speech Detection with Large Language Models—0
BanglaNum -- A Public Dataset for Bengali Digit Recognition from Speech—0
Isometric Neural Machine Translation using Phoneme Count Ratio Reward-based Reinforcement Learning—0
AdaMER-CTC: Connectionist Temporal Classification with Adaptive Maximum Entropy Regularization for Automatic Speech Recognition—0
Artificial Intelligence for Cochlear Implants: Review of Strategies, Challenges, and Perspectives—0
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children—0
The evaluation of a code-switched Sepedi-English automatic speech recognition system—0
Aligning Speech to Languages to Enhance Code-switching Speech Recognition—0
A New Benchmark for Evaluating Automatic Speech Recognition in the Arabic Call Domain—0
JEP-KD: Joint-Embedding Predictive Architecture Based Knowledge Distillation for Visual Speech Recognition—0
Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey—0
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview—0
Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition—0
Probing the Information Encoded in Neural-based Acoustic Models of Automatic Speech Recognition Systems—0
Twists, Humps, and Pebbles: Multilingual Speech Recognition Models Exhibit Gender Performance GapsCode0
Exploration of Adapter for Noise Robust Automatic Speech Recognition—0
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement—0
Extreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models—0
Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR—0
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification—0
Ain't Misbehavin' -- Using LLMs to Generate Expressive Robot Behavior in Conversations with the Tabletop Robot Haru—0
The Balancing Act: Unmasking and Alleviating ASR Biases in Portuguese—0
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models—0
Progressive unsupervised domain adaptation for ASR using ensemble models and multi-stage training—0
Resolving Transcription Ambiguity in Spanish: A Hybrid Acoustic-Lexical System for Punctuation Restoration—0
A Comprehensive Study of the Current State-of-the-Art in Nepali Automatic Speech Recognition Systems—0
Show:102550
← PrevPage 15 of 61Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1TM-CTCTest WER10.1—Unverified
2TM-seq2seqTest WER9.7—Unverified
3CTC/attentionTest WER8.2—Unverified
4LF-MMI TDNNTest WER6.7—Unverified
5Whisper-LLaMATest WER6.6—Unverified
6End2end ConformerTest WER3.9—Unverified
7End2end ConformerTest WER3.7—Unverified
8MoCo + wav2vec (w/o extLM)Test WER2.7—Unverified
9CTC/AttentionTest WER1.5—Unverified
10WhisperTest WER1.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SpatialNetCER14.5—Unverified
2CleanMel-L-maskCER14.4—Unverified
#ModelMetricClaimedVerifiedStatus
1ConformerTest WER15.32—Unverified
2Whisper-largev3-finetunedTest WER10.82—Unverified
#ModelMetricClaimedVerifiedStatus
1Conformer TransducerWER (%)1.89—Unverified
#ModelMetricClaimedVerifiedStatus
1DistillAVWER1.4—Unverified
#ModelMetricClaimedVerifiedStatus
1Conformer TransducerWER (%)4.28—Unverified
#ModelMetricClaimedVerifiedStatus
1Conformer TransducerWER (%)8.04—Unverified
#ModelMetricClaimedVerifiedStatus
1Conformer TransducerWER (%)3.36—Unverified
#ModelMetricClaimedVerifiedStatus
1Conformer Transducer (German)WER (%)8.98—Unverified