SOTAVerified

AudioCaps

Papers

Showing 51–64 of 64 papers

TitleStatusHype
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion—0
Audio-Visual LLM for Video Understanding—0
Automated Audio Captioning via Fusion of Low- and High- Dimensional Features—0
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs—0
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing—0
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval—0
DiffAVA: Personalized Text-to-Audio Generation with Visual Alignment—0
Dissecting Temporal Understanding in Text-to-Audio Retrieval—0
DiffGAP: A Lightweight Diffusion Module in Contrastive Space for Bridging Cross-Model Gap—0
Audio Captioning with Composition of Acoustic and Semantic Information—0
Enhancing Retrieval-Augmented Audio Captioning with Generation-Assisted Multimodal Querying and Progressive Learning—0
AudioCaps: Generating Captions for Audios in The Wild—0
FLAP: Fast Language-Audio Pre-training—0
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval—0
Show:102550
← PrevPage 3 of 3Next →

No leaderboard results yet.