SOTAVerified

Speech-to-Text Translation

Translate audio signals of speech in one language into text in a foreign language, either in an end-to-end or cascade manner.

Papers

Showing 51–75 of 146 papers

TitleStatusHype
An Empirical Study of Consistency Regularization for End-to-End Speech-to-Text TranslationCode0
SONAR: Sentence-Level Multimodal and Language-Agnostic RepresentationsCode2
SeamlessM4T: Massively Multilingual & Multimodal Machine TranslationCode2
On decoder-only architecture for speech-to-text and large language model integration—0
AudioPaLM: A Large Language Model That Can Speak and Listen—0
Recent Advances in Direct Speech-to-text Translation—0
Improved Cross-Lingual Transfer Learning For Automatic Speech Translation—0
Strategies for improving low resource speech to text translation relying on pre-trained ASR models—0
ComSL: A Composite Speech-Language Model for End-to-End Speech-to-Text TranslationCode1
DUB: Discrete Unit Back-translation for Speech TranslationCode1
Back Translation for Speech-to-text Translation Without TranscriptsCode1
Hybrid Transducer and Attention based Encoder-Decoder Modeling for Speech-to-Text Tasks—0
ESPnet-ST-v2: Multipurpose Spoken Language Translation Toolkit—0
Enhancing Speech-to-Speech Translation with Multiple TTS Targets—0
Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages—0
MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text TranslationCode2
Pre-training for Speech Translation: CTC Meets Optimal TransportCode1
WACO: Word-Aligned Contrastive Learning for Speech TranslationCode0
M3ST: Mix at Three Levels for Speech Translation—0
Efficient Speech Translation with Dynamic Latent PerceiversCode0
Don't Discard Fixed-Window Audio Segmentation in Speech-to-Text TranslationCode0
Simple and Effective Unsupervised Speech Translation—0
CTC Alignments Improve Autoregressive Translation—0
M-Adapter: Modality Adaptation for End-to-End Speech-to-Text TranslationCode0
Language Model Augmented Monotonic Attention for Simultaneous Translation—0
Show:102550
← PrevPage 3 of 6Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Task Modulation + Multitask Learning(ASR/MT) + Data AugmentationCase-sensitive sacreBLEU28.88—Unverified
2Wav2Vec2.0+mBART+AdaptorsCase-sensitive sacreBLEU28.22—Unverified
3Transformer + Meta Learning(ASR/MT) + Data AugmentationCase-sensitive sacreBLEU27.51—Unverified
4Transformer with AdaptersCase-sensitive sacreBLEU24.63—Unverified
5Dual-decoder TransformerCase-sensitive sacreBLEU23.63—Unverified
6SpeechformerCase-sensitive sacreBLEU23.6—Unverified
7Transformer + ASR PretrainCase-sensitive sacreBLEU22.8—Unverified
8Transformer + ASR PretrainCase-sensitive sacreBLEU22.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Transformer with AdaptersCase-sensitive sacreBLEU28.73—Unverified
2SpeechformerCase-sensitive sacreBLEU28.5—Unverified
3Dual-decoder TransformerCase-sensitive sacreBLEU28.12—Unverified
4Transformer + ASR Pretrain + SpecAugCase-sensitive sacreBLEU27.4—Unverified
5Transformer + ASR PretrainCase-sensitive sacreBLEU26.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Dual-decoder TransformerCase-sensitive sacreBLEU33.45—Unverified
2Transformer + ASR Pretrain + SpecAugCase-sensitive sacreBLEU33.3—Unverified
3Transformer + ASR PretrainCase-sensitive sacreBLEU32.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU30.6—Unverified
2SeamlessM4T MediumBLEU26.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU34.1—Unverified
2SeamlessM4T MediumBLEU29.8—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU21.5—Unverified
2SeamlessM4T MediumBLEU19.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU24—Unverified
2SeamlessM4T MediumBLEU20.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Transformer + ASR Pretrain + SpecAugCase-insensitive sacreBLEU17.2—Unverified
2Transformer + ASR PretrainCase-insensitive sacreBLEU16.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MediBeng Whisper TinyBleu0.98—Unverified
2Whisper TinyBleu0.3—Unverified
#ModelMetricClaimedVerifiedStatus
1Transformer with AdaptersSacreBLEU26.61—Unverified
2Dual-decoder TransformerSacreBLEU25.62—Unverified
#ModelMetricClaimedVerifiedStatus
1SpeechformerCase-sensitive sacreBLEU27.7—Unverified