SOTAVerified

Visual Question Answering (VQA)

Visual Question Answering (VQA) is a task in computer vision that involves answering questions about an image. The goal of VQA is to teach machines to understand the content of an image and answer questions about it in natural language.

Image Source: visualqa.org

Papers

Showing 1051–1100 of 2167 papers

TitleStatusHype
Visual Grounding Strategies for Text-Only Natural Language Processing—0
Visual Hallucination: Definition, Quantification, and Prescriptive Remediations—0
Visually Guided Spatial Relation Extraction from Text—0
Visual Mechanisms Inspired Efficient Transformers for Image and Video Quality Assessment—0
Visual Perturbation-aware Collaborative Learning for Overcoming the Language Prior Problem—0
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models—0
Visual Query Answering by Entity-Attribute Graph Matching and Reasoning—0
Visual Question Answering as a Meta Learning Task—0
Visual Question Answering as a Multi-Task Problem—0
Visual Question Answering as Reading Comprehension—0
Visual Question Answering: A Survey on Techniques and Common Trends in Recent Literature—0
Visual question answering based evaluation metrics for text-to-image generation—0
Visual Question Answering based on Formal Logic—0
Visual Question Answering based on Local-Scene-Aware Referring Expression Generation—0
Visual Question Answering Dataset for Bilingual Image Understanding: A Study of Cross-Lingual Transfer Using Attention Maps—0
Visual Question Answering for Cultural Heritage—0
Visual question answering: from early developments to recent advances -- a survey—0
Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective—0
Visual Question Answering in Remote Sensing with Cross-Attention and Multimodal Information Bottleneck—0
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks—0
Visual Question Answering in the Medical Domain—0
Visual Question Answering on 360° Images—0
Visual Question Answering on Image Sets—0
Visual Question Answering on Multiple Remote Sensing Image Modalities—0
Visual Question Answering Using Semantic Information from Image Descriptions—0
Visual Question Answering (VQA) on Images with Superimposed Text—0
Visual Question Answering with Memory-Augmented Networks—0
Visual Question Answering with Prior Class Semantics—0
Visual Question Answering with Question Representation Update (QRU)—0
Visual Question Decomposition on Multimodal Large Language Models—0
Visual Question Generation as Dual Task of Visual Question Answering—0
Visual Question: Predicting If a Crowd Will Agree on the Answer—0
Visual Question Reasoning on General Dependency Tree—0
Visual Reference Resolution using Attention Memory for Visual Dialog—0
Visual Relationship Detection using Scene Graphs: A Survey—0
Visual Superordinate Abstraction for Robust Concept Learning—0
Visual TTR - Modelling Visual Question Answering in Type Theory with Records—0
ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation—0
VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending—0
VL-BEiT: Generative Vision-Language Pretraining—0
VLMAE: Vision-Language Masked Autoencoder—0
VLM-Assisted Continual learning for Visual Question Answering in Self-Driving—0
VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation—0
EVJVQA Challenge: Multilingual Visual Question Answering—0
VMAF And Variants: Towards A Unified VQA—0
VQA-Aid: Visual Question Answering for Post-Disaster Damage Assessment and Analysis—0
VQA and Visual Reasoning: An Overview of Recent Datasets, Methods and Challenges—0
VQABQ: Visual Question Answering by Basic Questions—0
VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous Driving—0
VQA-E: Explaining, Elaborating, and Enhancing Your Answers for Visual Questions—0
Show:102550
← PrevPage 22 of 44Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1humanAccuracy89.3—Unverified
2DREAM+Unicoder-VL (MSRA)Accuracy76.04—Unverified
3TRRNet (Ensemble)Accuracy74.03—Unverified
4MIL-nbgaoAccuracy73.81—Unverified
5Kakao BrainAccuracy73.33—Unverified
6Coarse-to-Fine Reasoning, Single ModelAccuracy72.14—Unverified
7270Accuracy70.23—Unverified
8NSM ensemble (updated)Accuracy67.55—Unverified
9VinVL-DPTAccuracy64.92—Unverified
10VinVL+LAccuracy64.85—Unverified
#ModelMetricClaimedVerifiedStatus
1PaLIAccuracy84.3—Unverified
2BEiT-3Accuracy84.19—Unverified
3VLMoAccuracy82.78—Unverified
4ONE-PEACEAccuracy82.6—Unverified
5mPLUG (Huge)Accuracy82.43—Unverified
6CuMo-7BAccuracy82.2—Unverified
7X2-VLM (large)Accuracy81.9—Unverified
8MMUAccuracy81.26—Unverified
9InternVL-CAccuracy81.2—Unverified
10LyricsAccuracy81.2—Unverified
#ModelMetricClaimedVerifiedStatus
1BEiT-3overall84.03—Unverified
2mPLUG-Hugeoverall83.62—Unverified
3ONE-PEACEoverall82.52—Unverified
4X2-VLM (large)overall81.8—Unverified
5VLMooverall81.3—Unverified
6SimVLMoverall80.34—Unverified
7X2-VLM (base)overall80.2—Unverified
8VASToverall80.19—Unverified
9VALORoverall78.62—Unverified
10Prompt Tuningoverall78.53—Unverified