SOTAVerified

Audio captioning

Audio Captioning is the task of describing audio using text. The general approach is to use an audio encoder to encode the audio (example: PANN, CAV-MAE), and to use a decoder (example: transformer) to generate the text. To judge the quality of audio captions, though machine translation metrics (BLEU, METEOR, ROUGE) and image captioning metrics (SPICE, CIDER) are used, they are not very well-suited. Attempts have been made to use pretrained language model based metrics such as Sentence-BERT.

Papers

Showing 26–50 of 119 papers

TitleStatusHype
WaveTransformer: A Novel Architecture for Audio Captioning Based on Learning Temporal and Time-Frequency InformationCode1
Visually-Aware Audio Captioning With Adaptive Audio-Visual AttentionCode1
THE SJTU SYSTEM FOR DCASE2021 CHALLENGE TASK 6: AUDIO CAPTIONING BASED ON ENCODER PRE-TRAINING AND REINFORCEMENT LEARNINGCode1
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio EncodingCode1
Audio Retrieval with Natural Language Queries: A Benchmark StudyCode1
Training Audio Captioning Models without AudioCode1
RECAP: Retrieval-Augmented Audio CaptioningCode1
Clotho: An Audio Captioning DatasetCode1
MusCaps: Generating Captions for Music AudioCode1
CL4AC: A Contrastive Loss for Audio CaptioningCode1
LAVCap: LLM-based Audio-Visual Captioning using Optimal TransportCode1
Can Audio Captions Be Evaluated with Image Caption Metrics?Code1
Multimodal Knowledge Alignment with Reinforcement LearningCode1
A Whisper transformer for audio captioning trained with synthetic captions and transfer learningCode1
Is my automatic audio captioning system so bad? spider-max: a metric to consider several caption candidatesCode1
Prefix tuning for automated audio captioningCode1
Automated Audio Captioning with Epochal Difficult Captions for Curriculum Learning—0
Automated Audio Captioning via Fusion of Low- and High- Dimensional Features—0
Audio Captioning with Composition of Acoustic and Semantic Information—0
Automated Audio Captioning using Transfer Learning and Reconstruction Latent Space Similarity Regularization—0
Enhancing Retrieval-Augmented Audio Captioning with Generation-Assisted Multimodal Querying and Progressive Learning—0
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders—0
Automated Audio Captioning: An Overview of Recent Progress and New Challenges—0
Audio Captioning using Pre-Trained Large-Scale Language Model Guided by Audio-based Similar Caption Retrieval—0
Audio Captioning using Gated Recurrent Units—0
Show:102550
← PrevPage 2 of 5Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1VASTCIDEr0.78—Unverified
2VALORCIDEr0.74—Unverified
3MQ-CapSPIDEr0.52—Unverified
4SLAM-AACSPIDEr0.52—Unverified
5LAVCapSPIDEr0.52—Unverified
6EnCLAP++-largeSPIDEr0.51—Unverified
7AutoCapSPIDEr0.51—Unverified
8LOAESPIDEr0.51—Unverified
9EnCLAP++-baseSPIDEr0.5—Unverified
10EnCLAP-largeSPIDEr0.5—Unverified
#ModelMetricClaimedVerifiedStatus
1VASTCIDEr0.52—Unverified
2VALORCIDEr0.42—Unverified
3SLAM-AACSPIDEr0.33—Unverified
4LOAESPIDEr0.33—Unverified
5MQ-CapSPIDEr0.32—Unverified
6EnsembleSPIDEr0.32—Unverified
7Audio Flamingo (Pengi trainset)SPIDEr0.31—Unverified
8Ensemble-RLSPIDEr0.3—Unverified
9Qwen-AudioSPIDEr0.29—Unverified
10EnsembleSPIDEr0.21—Unverified