SOTAVerified

Visual Dialog

Visual Dialog requires an AI agent to hold a meaningful dialog with humans in natural, conversational language about visual content. Specifically, given an image, a dialog history, and a follow-up question about the image, the task is to answer the question.

Papers

Showing 1–50 of 118 papers

TitleStatusHype
Mini-Gemini: Mining the Potential of Multi-modality Vision Language ModelsCode7
Hawk: Learning to Understand Open-World Video AnomaliesCode3
Unified Multimodal Model with Unlikelihood Training for Visual DialogCode1
Large-scale Pretraining for Visual Dialog: A Simple State-of-the-Art BaselineCode1
An Annotated Corpus of Reference Resolution for Interpreting Common GroundingCode1
Ensemble of MRR and NDCG models for Visual DialogCode1
Iterative Context-Aware Graph Inference for Visual DialogCode1
The Dialog Must Go On: Improving Visual Dialog via Generative Self-TrainingCode1
Learning Cooperative Visual Dialog Agents with Deep Reinforcement LearningCode1
Visual DialogCode1
Multi-View Attention Network for Visual DialogCode1
Large-Scale Answerer in Questioner's Mind for Visual Dialog Question GenerationCode1
VD-PCR: Improving Visual Dialog with Pronoun Coreference ResolutionCode1
Audio Visual Scene-Aware Dialog (AVSD) Challenge at DSTC7Code1
History for Visual Dialog: Do we really need it?Code1
VD-BERT: A Unified Vision and Dialog Transformer with BERTCode1
Video Dialog as Conversation about Objects Living in Space-TimeCode1
Where Are You? Localization from Embodied DialogCode1
Hierarchical Question-Image Co-Attention for Visual Question AnsweringCode1
Answerer in Questioner's Mind: Information Theoretic Approach to Goal-Oriented Visual DialogCode1
Reasoning Visual Dialog with Sparse Graph Learning and Knowledge TransferCode1
Visual Dialogue State Tracking for Question GenerationCode1
Building Task-Oriented Visual Dialog Systems Through Alternative Optimization Between Dialog Policy and Language Generation—0
Modeling Coreference Relations in Visual Dialog—0
Multimodal Hierarchical Reinforcement Learning Policy for Task-Oriented Visual Dialog—0
Effective questions in referential visual dialogue—0
Gold Seeker: Information Gain from Policy Distributions for Goal-oriented Vision-and-Langauge Reasoning—0
Adversarial Robustness of Visual Dialog—0
Enhancing Visual Dialog State Tracking through Iterative Object-Entity Alignment in Multi-Round Conversations—0
ENRICH4ALL: A First Luxembourgish BERT Model for a Multilingual Chatbot—0
A survey on knowledge-enhanced multimodal learning—0
VD-GR: Boosting Visual Dialog with Cascaded Spatial-Temporal Multi-Modal GRaphs—0
Modality-Balanced Models for Visual Dialogue—0
Multi-Modal Open-Domain Dialogue—0
Discourse Analysis for Evaluating Coherence in Video Paragraph Captions—0
A Generative Adversarial Density Estimator—0
Learning Goal-Oriented Visual Dialog Agents: Imitating and Surpassing Analytic Experts—0
Grounded Agreement Games: Emphasizing Conversational Grounding in Visual Dialogue Settings—0
Are You Talking to Me? Reasoned Visual Dialog Generation through Adversarial Learning—0
Granular Multimodal Attention Networks for Visual Dialog—0
GoG: Relation-aware Graph-over-Graph Network for Visual Dialog—0
Learning to Ground Visual Objects for Visual Dialog—0
Generative Visual Dialogue System via Adaptive Reasoning and Weighted Likelihood Estimation—0
FlipDial: A Generative Model for Two-Way Visual Dialogue—0
How to Fool Systems and Humans in Visually Grounded Interaction: A Case Study on Adversarial Attacks on Visual Dialog—0
ICCV23 Visual-Dialog Emotion Explanation Challenge: SEU_309 Team Technical Report—0
Image-Question-Answer Synergistic Network for Visual Dialog—0
Improving Cross-Modal Understanding in Visual Dialog via Contrastive Learning—0
Connecting Language and Vision to Actions—0
FlexCap: Describe Anything in Images in Controllable Detail—0
Show:102550
← PrevPage 1 of 3Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1SingleNDCG (x 100)78.7—Unverified
2P1P2+Distill+EnsembleNDCG (x 100)77.92—Unverified
3Ensemble + Fine-tuningNDCG (x 100)76.43—Unverified
4ensemble, finetuneNDCG (x 100)76.17—Unverified
5VD-PCRNDCG (x 100)76.14—Unverified
6EnsembleNDCG (x 100)75.35—Unverified
7Ensemble + FinetuneNDCG (x 100)74.88—Unverified
8bert-double-stream-finetuningNDCG (x 100)74.62—Unverified
9CE-finetuned, single modelNDCG (x 100)74.47—Unverified
102NDCG (x 100)73.36—Unverified
#ModelMetricClaimedVerifiedStatus
19xFGA (VGG)MRR68.92—Unverified
2DANMRR66.38—Unverified
3CorefNMN (ResNet-152)MRR64.1—Unverified
4CoAttMRR63.98—Unverified
5CorefNMNMRR63.6—Unverified
6DualVDMRR62.94—Unverified
7SF-QIH-se-2MRR62.42—Unverified
8HCIAE-NP-ATTMRR62.22—Unverified
9HieCoAtt-QIMRR57.88—Unverified
10AMEMR@148.53—Unverified
#ModelMetricClaimedVerifiedStatus
15xFGA + LSNDCG64.04—Unverified
25xFGA + LS*+MRR0.71—Unverified
3Two-StepMRR0.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Multi-Modal BlenderBotBLEU-41—Unverified
#ModelMetricClaimedVerifiedStatus
1Multi-Modal BlenderBotBLEU-41.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Multi-Modal BlenderBotBLEU-41.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Multi-Modal BlenderBotBLEU-440—Unverified
#ModelMetricClaimedVerifiedStatus
1Multi-Modal BlenderBotBLEU-42.2—Unverified