SOTAVerified

Speech-to-Text Translation

Translate audio signals of speech in one language into text in a foreign language, either in an end-to-end or cascade manner.

Papers

Showing 26–50 of 146 papers

TitleStatusHype
Investigating Decoder-only Large Language Models for Speech-to-text Translation—0
NAIST Simultaneous Speech Translation System for IWSLT 2024—0
Voices Unheard: NLP Resources and Models for Yorùbá Regional DialectsCode0
ArzEn-LLM: Code-Switched Egyptian Arabic-English Translation and Speech Recognition Using LLMsCode1
SimulSeamless: FBK at IWSLT 2024 Simultaneous Speech Translation—0
Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?—0
StreamAtt: Direct Streaming Speech-to-Text Translation with Attention-based Audio History Selection—0
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task LearningCode5
LeaPformer: Enabling Linear Transformers for Autoregressive and Simultaneous Tasks via Learned ProportionsCode1
Robust Semantic Communications for Speech Transmission—0
Compact Speech Translation Models via Discrete Speech Units Pretraining—0
Speech Translation with Speech Foundation Models and Large Language Models: What is There and What is Missing?—0
Pushing the Limits of Zero-shot End-to-End Speech TranslationCode1
Prosody in Cascade and Direct Speech-to-Text Translation: a case study on Korean Wh-Phrases—0
Investigating Zero-Shot Generalizability on Mandarin-English Code-Switched ASR and Speech-to-text Translation of Recent Foundation Models with Self-Supervision and Weak SupervisionCode0
Efficient Monotonic Multihead Attention—0
End-to-End Speech-to-Text Translation: A Survey—0
COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning—0
End-to-End Single-Channel Speaker-Turn Aware Conversational Speech TranslationCode1
LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPTCode2
Improving Stability in Simultaneous Speech Translation: A Revision-Controllable Decoding Approach—0
Modular Speech-to-Text Translation for Zero-Shot Cross-Modal Transfer—0
Cross-Modal Multi-Tasking for Speech-to-Text Translation via Hard Parameter Sharing—0
SpeechAlign: a Framework for Speech Translation Alignment Evaluation—0
CoLLD: Contrastive Layer-to-layer Distillation for Compressing Multilingual Pre-trained Speech Encoders—0
Show:102550
← PrevPage 2 of 6Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Task Modulation + Multitask Learning(ASR/MT) + Data AugmentationCase-sensitive sacreBLEU28.88—Unverified
2Wav2Vec2.0+mBART+AdaptorsCase-sensitive sacreBLEU28.22—Unverified
3Transformer + Meta Learning(ASR/MT) + Data AugmentationCase-sensitive sacreBLEU27.51—Unverified
4Transformer with AdaptersCase-sensitive sacreBLEU24.63—Unverified
5Dual-decoder TransformerCase-sensitive sacreBLEU23.63—Unverified
6SpeechformerCase-sensitive sacreBLEU23.6—Unverified
7Transformer + ASR PretrainCase-sensitive sacreBLEU22.8—Unverified
8Transformer + ASR PretrainCase-sensitive sacreBLEU22.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Transformer with AdaptersCase-sensitive sacreBLEU28.73—Unverified
2SpeechformerCase-sensitive sacreBLEU28.5—Unverified
3Dual-decoder TransformerCase-sensitive sacreBLEU28.12—Unverified
4Transformer + ASR Pretrain + SpecAugCase-sensitive sacreBLEU27.4—Unverified
5Transformer + ASR PretrainCase-sensitive sacreBLEU26.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Dual-decoder TransformerCase-sensitive sacreBLEU33.45—Unverified
2Transformer + ASR Pretrain + SpecAugCase-sensitive sacreBLEU33.3—Unverified
3Transformer + ASR PretrainCase-sensitive sacreBLEU32.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU30.6—Unverified
2SeamlessM4T MediumBLEU26.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU34.1—Unverified
2SeamlessM4T MediumBLEU29.8—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU21.5—Unverified
2SeamlessM4T MediumBLEU19.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU24—Unverified
2SeamlessM4T MediumBLEU20.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Transformer + ASR Pretrain + SpecAugCase-insensitive sacreBLEU17.2—Unverified
2Transformer + ASR PretrainCase-insensitive sacreBLEU16.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MediBeng Whisper TinyBleu0.98—Unverified
2Whisper TinyBleu0.3—Unverified
#ModelMetricClaimedVerifiedStatus
1Transformer with AdaptersSacreBLEU26.61—Unverified
2Dual-decoder TransformerSacreBLEU25.62—Unverified
#ModelMetricClaimedVerifiedStatus
1SpeechformerCase-sensitive sacreBLEU27.7—Unverified