SOTAVerified

Visual Dialog

Visual Dialog requires an AI agent to hold a meaningful dialog with humans in natural, conversational language about visual content. Specifically, given an image, a dialog history, and a follow-up question about the image, the task is to answer the question.

Papers

Showing 51–100 of 118 papers

TitleStatusHype
Multi-step Reasoning via Recurrent Dual Attention for Visual Dialog—0
ORD: Object Relationship Discovery for Visual Dialogue Generation—0
PIRC Net : Using Proposal Indexing, Relationships and Context for Phrase Grounding—0
Probabilistic framework for solving Visual Dialog—0
Pushing the Limits of Radiology with Joint Modeling of Visual and Textual Information—0
Reactive Multi-Stage Feature Fusion for Multimodal Dialogue Modeling—0
Reasoning Over History: Context Aware Visual Dialog—0
Reasoning with Multi-Structure Commonsense Knowledge in Visual Dialog—0
Region under Discussion for visual dialog—0
Response to "Visual Dialogue without Vision or Dialogue" (Massiceti et al., 2018)—0
The Impact of Answers in Referential Visual Dialog—0
The World in My Mind: Visual Dialog with Adversarial Multi-modal Feature Encoding—0
Towards Visual Dialog for Radiology—0
Two can play this Game: Visual Dialog with Discriminative Question Generation and Answering—0
UTC: A Unified Transformer with Inter-Task Contrastive Learning for Visual Dialog—0
V^2Dial: Unification of Video and Visual Dialog via Multimodal Experts—0
V^2Dial: Unification of Video and Visual Dialog via Multimodal Experts—0
Variational Disentangled Attention for Regularized Visual Dialog—0
ViDA-MAN: Visual Dialog with Digital Humans—0
On Controlled DeEntanglement for Natural Language Processing—0
Vision and Language: from Visual Perception to Content Creation—0
Visual Reference Resolution using Attention Memory for Visual Dialog—0
Visual-Textual Alignment for Graph Inference in Visual Dialog—0
VU-BERT: A Unified framework for Visual Dialog—0
What Should I Ask? Using Conversationally Informative Rewards for Goal-oriented Visual Dialog.—0
What Should I Ask? Using Conversationally Informative Rewards for Goal-Oriented Visual Dialog—0
What's to know? Uncertainty as a Guide to Asking Goal-oriented Questions—0
How to Fool Systems and Humans in Visually Grounded Interaction: A Case Study on Adversarial Attacks on Visual Dialog—0
ICCV23 Visual-Dialog Emotion Explanation Challenge: SEU_309 Team Technical Report—0
Image-Question-Answer Synergistic Network for Visual Dialog—0
Improving Cross-Modal Understanding in Visual Dialog via Contrastive Learning—0
Knowledge Transfer with Visual Prompt in multi-modal Dialogue Understanding and Generation—0
LAVIS: A Library for Language-Vision Intelligence—0
Learning Goal-Oriented Visual Dialog Agents: Imitating and Surpassing Analytic Experts—0
Learning to Ground Visual Objects for Visual Dialog—0
Factor Graph AttentionCode0
Reasoning Visual Dialogs with Structural and Partial ObservationsCode0
Visual Dialogue without Vision or DialogueCode0
Recursive Visual Attention in Visual DialogCode0
Collecting Visually-Grounded Dialogue with A Game Of SortsCode0
Examining Cooperation in Visual Dialog ModelsCode0
CLEVR-Dialog: A Diagnostic Dataset for Multi-Round Reasoning in Visual DialogCode0
Enhancing Visual Dialog Questioner with Entity-based Strategy Learning and Augmented GuesserCode0
Efficient Attention Mechanism for Visual Dialog that can Handle All the Interactions between Multiple InputsCode0
SeqDialN: Sequential Visual Dialog Network in Joint Visual-Linguistic Representation SpaceCode0
Learning Better Visual Dialog Agents with Pretrained Visual-Linguistic RepresentationCode0
DualVD: An Adaptive Dual Encoding Model for Deep Visual Understanding in Visual DialogueCode0
SeqDialN: Sequential Visual Dialog Networks in Joint Visual-Linguistic Representation SpaceCode0
Learning Goal-Oriented Visual Dialog via Tempered Policy GradientCode0
Spot the Difference: A Cooperative Object-Referring Game in Non-Perfectly Co-Observable SceneCode0
Show:102550
← PrevPage 2 of 3Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1SingleNDCG (x 100)78.7—Unverified
2P1P2+Distill+EnsembleNDCG (x 100)77.92—Unverified
3Ensemble + Fine-tuningNDCG (x 100)76.43—Unverified
4ensemble, finetuneNDCG (x 100)76.17—Unverified
5VD-PCRNDCG (x 100)76.14—Unverified
6EnsembleNDCG (x 100)75.35—Unverified
7Ensemble + FinetuneNDCG (x 100)74.88—Unverified
8bert-double-stream-finetuningNDCG (x 100)74.62—Unverified
9CE-finetuned, single modelNDCG (x 100)74.47—Unverified
102NDCG (x 100)73.36—Unverified
#ModelMetricClaimedVerifiedStatus
19xFGA (VGG)MRR68.92—Unverified
2DANMRR66.38—Unverified
3CorefNMN (ResNet-152)MRR64.1—Unverified
4CoAttMRR63.98—Unverified
5CorefNMNMRR63.6—Unverified
6DualVDMRR62.94—Unverified
7SF-QIH-se-2MRR62.42—Unverified
8HCIAE-NP-ATTMRR62.22—Unverified
9HieCoAtt-QIMRR57.88—Unverified
10AMEMR@148.53—Unverified
#ModelMetricClaimedVerifiedStatus
15xFGA + LSNDCG64.04—Unverified
25xFGA + LS*+MRR0.71—Unverified
3Two-StepMRR0.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Multi-Modal BlenderBotBLEU-41—Unverified
#ModelMetricClaimedVerifiedStatus
1Multi-Modal BlenderBotBLEU-41.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Multi-Modal BlenderBotBLEU-41.5—Unverified
#ModelMetricClaimedVerifiedStatus
1Multi-Modal BlenderBotBLEU-440—Unverified
#ModelMetricClaimedVerifiedStatus
1Multi-Modal BlenderBotBLEU-42.2—Unverified