SOTAVerified

Image to text

Papers

Showing 101–125 of 246 papers

TitleStatusHype
Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models—0
PiTL: Cross-modal Retrieval with Weakly-supervised Vision-language Pre-training via Prompting—0
Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning—0
Towards Cross-modal Retrieval in Chinese Cultural Heritage Documents: Dataset and Solution—0
ABC: Achieving Better Control of Multimodal Embeddings using VLMs—0
Accept the Modality Gap: An Exploration in the Hyperbolic Space—0
Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training—0
AICoderEval: Improving AI Domain Code Generation of Large Language Models—0
AI Recommendation System for Enhanced Customer Experience: A Novel Image-to-Text Method—0
An End-to-End Neural Network for Image-to-Audio Transformation—0
An Online Learning Approach to Prompt-based Selection of Generative Models—0
Ask, Attend, Attack: A Effective Decision-Based Black-Box Targeted Attack for Image-to-Text Models—0
A Thousand Words Are Worth More Than a Picture: Natural Language-Centric Outside-Knowledge Visual Question Answering—0
Attention Guidance Mechanism for Handwritten Mathematical Expression Recognition—0
A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models—0
Backdooring Vision-Language Models with Out-Of-Distribution Data—0
Better Text Understanding Through Image-To-Text Transfer—0
Beyond Color and Lines: Zero-Shot Style-Specific Image Variations with Coordinated Semantics—0
Beyond Images: An Integrative Multi-modal Approach to Chest X-Ray Report Generation—0
BiLMa: Bidirectional Local-Matching for Text-based Person Re-identification—0
BIMCV-R: A Landmark Dataset for 3D CT Text-Image Retrieval—0
BRIT: Bidirectional Retrieval over Unified Image-Text Graph—0
Canonical Correlation Analysis for Misaligned Satellite Image Change Detection—0
CapText: Large Language Model-based Caption Generation From Image Context and Description—0
Captions Are Worth a Thousand Words: Enhancing Product Retrieval with Pretrained Image-to-Text Models—0
Show:102550
← PrevPage 5 of 10Next →

No leaderboard results yet.