SOTAVerified

Speech-to-Text

Papers

Showing 276–300 of 403 papers

TitleStatusHype
MMSpeech: Multi-modal Multi-task Encoder-Decoder Pre-training for Speech Recognition—0
Modular Speech-to-Text Translation for Zero-Shot Cross-Modal Transfer—0
Multi-Discriminator Sobolev Defense-GAN Against Adversarial Attacks for End-to-End Speech Systems—0
Multilingual Speech Emotion Recognition With Multi-Gating Mechanism and Neural Architecture Search—0
Multilingual Speech Translation from Efficient Finetuning of Pretrained Models—0
Multi-teacher Distillation for Multilingual Spelling Correction—0
NAIST Simultaneous Speech-to-Text Translation System for IWSLT 2022—0
NAIST Simultaneous Speech Translation System for IWSLT 2024—0
Named Entity Detection and Injection for Direct Speech Translation—0
Named Entity Recognition for Address Extraction in Speech-to-Text Transcriptions Using Synthetic Data—0
Natural Language Interactions in Autonomous Vehicles: Intent Detection and Slot Filling from Passenger Utterances—0
Natural Language Robot Programming: NLP integrated with autonomous robotic grasping—0
NaturalTurn: A Method to Segment Transcripts into Naturalistic Conversational Turns—0
NeKo: Toward Post Recognition Generative Correction Large Language Models with Task-Oriented Experts—0
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision—0
N-gram Boosting: Improving Contextual Biasing with Normalized N-gram Targets—0
Noise in Speech-to-Text Voice: Analysis of Errors and Feasibility of Phonetic Similarity for Their Correction—0
Numerically Grounded Language Models for Semantic Error Correction—0
Advancing STT for Low-Resource Real-World Speech—0
OAVA: the open audio-visual archives aggregator—0
On decoder-only architecture for speech-to-text and large language model integration—0
Online Hybrid CTC/Attention End-to-End Automatic Speech Recognition Architecture—0
On the Design of Strategic Task Recommendations for Sustainable Crowdsourcing-Based Content Moderation—0
On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models—0
On the Feasibility of Fully AI-automated Vishing Attacks—0
Show:102550
← PrevPage 12 of 17Next →

No leaderboard results yet.