SOTAVerified

Caption Generation

Papers

Showing 176–200 of 310 papers

TitleStatusHype
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning—0
Unpaired Cross-lingual Image Caption Generation with Self-Supervised Rewards—0
UNISON: Unpaired Cross-lingual Image Captioning—0
ViCo: Engaging Video Comment Generation with Human Preference Rewards—0
Video Caption Dataset for Describing Human Actions in Japanese—0
Video Captioning in Compressed Video—0
Video Captioning with Guidance of Multimodal Latent Topics—0
Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives—0
Visual Analytics for Efficient Image Exploration and User-Guided Image Captioning—0
Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation—0
WAT2019: English-Hindi Translation on Hindi Visual Genome Dataset—0
Denoising Large-Scale Image Captioning from Alt-text Data using Content Selection Models—0
Weakly Supervised Dense Video Captioning via Jointly Usage of Knowledge Distillation and Cross-modal Matching—0
What is not where: the challenge of integrating spatial representations into deep learning architectures—0
Word to Sentence Visual Semantic Similarity for Caption Generation: Lessons Learned—0
XMeCap: Meme Caption Generation with Sub-Image Adaptability—0
YouMakeup: A Large-Scale Domain-Specific Multimodal Dataset for Fine-Grained Semantic Comprehension—0
3G structure for image caption generation—0
3M: Multi-style image caption generation using Multi-modality features under Multi-UPDOWN model—0
A Comparative Study of Pre-trained CNNs and GRU-Based Attention for Image Caption Generation—0
A Deep Neural Framework for Image Caption Generation Using GRU-Based Attention Mechanism—0
Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation—0
AIC-AB NET: A Neural Network for Image Captioning with Spatial Attention and Text Attributes—0
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning—0
Aligning Images and Text with Semantic Role Labels for Fine-Grained Cross-Modal Understanding—0
Show:102550
← PrevPage 8 of 13Next →

No leaderboard results yet.