SOTAVerified

Speech-to-Text Translation

Translate audio signals of speech in one language into text in a foreign language, either in an end-to-end or cascade manner.

Papers

Showing 51–75 of 146 papers

TitleStatusHype
Augmenting Librispeech with French Translations: A Multimodal Corpus for Direct Speech Translation EvaluationCode0
Pre-training on high-resource speech recognition improves low-resource speech-to-text translationCode0
An Empirical Study of Consistency Regularization for End-to-End Speech-to-Text TranslationCode0
Direct speech-to-speech translation with a sequence-to-sequence modelCode0
M-Adapter: Modality Adaptation for End-to-End Speech-to-Text TranslationCode0
Voices Unheard: NLP Resources and Models for Yorùbá Regional DialectsCode0
fairseq S2T: Fast Speech-to-Text Modeling with fairseqCode0
On decoder-only architecture for speech-to-text and large language model integration—0
Pay Better Attention to Attention: Head Selection in Multilingual and Multi-Domain Sequence Modeling—0
Prosody in Cascade and Direct Speech-to-Text Translation: a case study on Korean Wh-Phrases—0
Recent Advances in Direct Speech-to-text Translation—0
Representation Purification for End-to-End Speech Translation—0
Revisiting End-to-End Speech-to-Text Translation From Scratch—0
Robust Semantic Communications for Speech Transmission—0
S2ST-Omni: An Efficient and Scalable Multilingual Speech-to-Speech Translation Framework via Seamless Speech-Text Alignment and Streaming Speech Generation—0
SAMU-XLSR: Semantically-Aligned Multimodal Utterance-level Cross-Lingual Speech Representation—0
Self-Supervised Representations Improve End-to-End Speech Translation—0
Simple and Effective Unsupervised Speech Translation—0
SimulSeamless: FBK at IWSLT 2024 Simultaneous Speech Translation—0
SimulSpeech: End-to-End Simultaneous Speech to Text Translation—0
SpeechAlign: a Framework for Speech Translation Alignment Evaluation—0
Speech is More Than Words: Do Speech-to-Text Translation Systems Leverage Prosody?—0
Speech to Speech Translation with Translatotron: A State of the Art Review—0
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios—0
Speech Translation with Speech Foundation Models and Large Language Models: What is There and What is Missing?—0
Show:102550
← PrevPage 3 of 6Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Task Modulation + Multitask Learning(ASR/MT) + Data AugmentationCase-sensitive sacreBLEU28.88—Unverified
2Wav2Vec2.0+mBART+AdaptorsCase-sensitive sacreBLEU28.22—Unverified
3Transformer + Meta Learning(ASR/MT) + Data AugmentationCase-sensitive sacreBLEU27.51—Unverified
4Transformer with AdaptersCase-sensitive sacreBLEU24.63—Unverified
5Dual-decoder TransformerCase-sensitive sacreBLEU23.63—Unverified
6SpeechformerCase-sensitive sacreBLEU23.6—Unverified
7Transformer + ASR PretrainCase-sensitive sacreBLEU22.8—Unverified
8Transformer + ASR PretrainCase-sensitive sacreBLEU22.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Transformer with AdaptersCase-sensitive sacreBLEU28.73—Unverified
2SpeechformerCase-sensitive sacreBLEU28.5—Unverified
3Dual-decoder TransformerCase-sensitive sacreBLEU28.12—Unverified
4Transformer + ASR Pretrain + SpecAugCase-sensitive sacreBLEU27.4—Unverified
5Transformer + ASR PretrainCase-sensitive sacreBLEU26.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Dual-decoder TransformerCase-sensitive sacreBLEU33.45—Unverified
2Transformer + ASR Pretrain + SpecAugCase-sensitive sacreBLEU33.3—Unverified
3Transformer + ASR PretrainCase-sensitive sacreBLEU32.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU30.6—Unverified
2SeamlessM4T MediumBLEU26.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU34.1—Unverified
2SeamlessM4T MediumBLEU29.8—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU21.5—Unverified
2SeamlessM4T MediumBLEU19.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SeamlessM4T LargeBLEU24—Unverified
2SeamlessM4T MediumBLEU20.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Transformer + ASR Pretrain + SpecAugCase-insensitive sacreBLEU17.2—Unverified
2Transformer + ASR PretrainCase-insensitive sacreBLEU16.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MediBeng Whisper TinyBleu0.98—Unverified
2Whisper TinyBleu0.3—Unverified
#ModelMetricClaimedVerifiedStatus
1Transformer with AdaptersSacreBLEU26.61—Unverified
2Dual-decoder TransformerSacreBLEU25.62—Unverified
#ModelMetricClaimedVerifiedStatus
1SpeechformerCase-sensitive sacreBLEU27.7—Unverified