SOTAVerified

Image Description

Papers

Showing 1120 of 154 papers

TitleStatusHype
SPIDER: A Comprehensive Multi-Organ Supervised Pathology Dataset and Baseline ModelsCode1
Grounded Video DescriptionCode1
UniTAB: Unifying Text and Box Outputs for Grounded Vision-Language ModelingCode1
Revisiting Binary Local Image Description for Resource Limited DevicesCode1
Can Large Multimodal Models Uncover Deep Semantics Behind Images?Code1
CIDEr: Consensus-based Image Description EvaluationCode1
Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence ModelsCode1
Chatting Makes Perfect: Chat-based Image RetrievalCode1
Mitigating Hallucinations in Vision-Language Models through Image-Guided Head SuppressionCode1
Text-Visual Semantic Constrained AI-Generated Image Quality AssessmentCode1
Show:102550
← PrevPage 2 of 16Next →

No leaderboard results yet.