Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1651–1700 of 10817 papers

Title	Date	Tasks	Status	Hype	Score
CoLoR-Filter: Conditional Loss Reduction Filtering for Targeted Language Model Pre-training	Jun 15, 2024	Domain AdaptationLanguage Modeling	CodeCode Available	1	5
Knowledge-Based Video Question Answering with Unsupervised Scene Descriptions	Jul 17, 2020	Question AnsweringVideo Question Answering	CodeCode Available	1	5
Knowledge-driven Data Construction for Zero-shot Evaluation in Commonsense Question Answering	Nov 7, 2020	Language ModelingLanguage Modelling	CodeCode Available	1	5
Fine-grained Image Classification and Retrieval by Combining Visual and Locally Pooled Textual Features	Jan 14, 2020	ClassificationDiversity	CodeCode Available	1	5
KLEJ: Comprehensive Benchmark for Polish Language Understanding	May 1, 2020	named-entity-recognitionNamed Entity Recognition	CodeCode Available	1	5
KITLM: Domain-Specific Knowledge InTegration into Language Models for Question Answering	Aug 7, 2023	Language ModelingLanguage Modelling	CodeCode Available	1	5
AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors	Oct 26, 2023	DeepFake DetectionFace Swapping	CodeCode Available	1	5
PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos	Dec 2, 2024	Question AnsweringVideo Understanding	CodeCode Available	1	5
Knowing More About Questions Can Help: Improving Calibration in Question Answering	Jun 2, 2021	Answer GenerationData Augmentation	CodeCode Available	1	5
Building Efficient and Effective OpenQA Systems for Low-Resource Languages	Jan 7, 2024	Machine TranslationQuestion Answering	CodeCode Available	1	5
Collab-RAG: Boosting Retrieval-Augmented Generation for Complex Question Answering via White-Box and Black-Box LLM Collaboration	Apr 7, 2025	Language ModelingLanguage Modelling	CodeCode Available	1	5
FiTs: Fine-grained Two-stage Training for Knowledge-aware Question Answering	Feb 23, 2023	Knowledge GraphsMedical Question Answering	CodeCode Available	1	5
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment	Feb 21, 2024	Language ModellingQuestion Answering	CodeCode Available	1	5
FloodNet: A High Resolution Aerial Imagery Dataset for Post Flood Scene Understanding	Dec 5, 2020	image-classificationImage Classification	CodeCode Available	1	5
Knowledgeable Preference Alignment for LLMs in Domain-specific Question Answering	Nov 11, 2023	Knowledge GraphsQuestion Answering	CodeCode Available	1	5
Plug-and-Play Document Modules for Pre-trained Models	May 28, 2023	Question Answering	CodeCode Available	1	5
Fool Your (Vision and) Language Model With Embarrassingly Simple Permutations	Oct 2, 2023	In-Context LearningInstruction Following	CodeCode Available	1	5
FoodieQA: A Multimodal Dataset for Fine-Grained Understanding of Chinese Food Culture	Jun 16, 2024	DiversityMultiple-choice	CodeCode Available	1	5
Formal Query Building with Query Structure Prediction for Complex Question Answering over Knowledge Base	Sep 8, 2021	DecoderGraph Generation	CodeCode Available	1	5
Knowledge Editing with Dynamic Knowledge Graphs for Multi-Hop Question Answering	Dec 18, 2024	graph constructionknowledge editing	CodeCode Available	1	5
A Survey on Efficient Vision-Language Models	Apr 13, 2025	Image CaptioningQuestion Answering	CodeCode Available	1	5
ByT5: Towards a token-free future with pre-trained byte-to-byte models	May 28, 2021	Cross-Lingual Natural Language InferenceCross-Lingual NER	CodeCode Available	1	5
KGLM: Integrating Knowledge Graph Structure in Language Models for Link Prediction	Nov 4, 2022	Fraud DetectionKnowledge Graph Completion	CodeCode Available	1	5
CABINET: Content Relevance based Noise Reduction for Table Question Answering	Feb 2, 2024	In-Context LearningQuestion Answering	CodeCode Available	1	5
CodeQA: A Question Answering Dataset for Source Code Comprehension	Sep 17, 2021	Machine Reading ComprehensionQuestion Answering	CodeCode Available	1	5
COBRA: Contrastive Bi-Modal Representation Algorithm	May 7, 2020	Cross-Modal RetrievalImage Captioning	CodeCode Available	1	5
Code-Style In-Context Learning for Knowledge-Based Question Answering	Sep 9, 2023	Code GenerationIn-Context Learning	CodeCode Available	1	5
KG-Retriever: Efficient Knowledge Indexing for Retrieval-Augmented Large Language Models	Dec 7, 2024	Multi-hop Question AnsweringNavigate	CodeCode Available	1	5
Coarse-to-Fine Vision-Language Pre-training with Fusion in the Backbone	Jun 15, 2022	Described Object DetectionImage Captioning	CodeCode Available	1	5
CogMG: Collaborative Augmentation Between Large Language Model and Knowledge Graph	Jun 25, 2024	Knowledge Graph CompletionKnowledge Graphs	CodeCode Available	1	5
Coarse-to-Fine Reasoning for Visual Question Answering	Oct 6, 2021	Question AnsweringVisual Question Answering	CodeCode Available	1	5
CAT-ViL: Co-Attention Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery	Jul 11, 2023	Question AnsweringScene Understanding	CodeCode Available	1	5
Compositional Semantic Parsing on Semi-Structured Tables	Aug 3, 2015	Question AnsweringSemantic Parsing	CodeCode Available	1	5
Calibrating Large Language Models Using Their Generations Only	Mar 9, 2024	Question AnsweringText Generation	CodeCode Available	1	5
Predicting the Performance of Black-box LLMs through Self-Queries	Jan 2, 2025	Question Answering	CodeCode Available	1	5
KILT: a Benchmark for Knowledge Intensive Language Tasks	Sep 4, 2020	Entity LinkingFact Checking	CodeCode Available	1	5
KQA Pro: A Dataset with Explicit Compositional Programs for Complex Question Answering over Knowledge Base	Jul 8, 2020	AttributeDiagnostic	CodeCode Available	1	5
From Values to Opinions: Predicting Human Behaviors and Stances Using Value-Injected Large Language Models	Oct 27, 2023	MarketingQuestion Answering	CodeCode Available	1	5
Clues Before Answers: Generation-Enhanced Multiple-Choice QA	Apr 30, 2022	DecoderMultiple-choice	CodeCode Available	1	5
From Representation to Reasoning: Towards both Evidence and Commonsense Reasoning for Video Question-Answering	May 30, 2022	counterfactualDescriptive	CodeCode Available	1	5
CALM : A Multi-task Benchmark for Comprehensive Assessment of Language Model Bias	Aug 24, 2023	DiversityLanguage Modeling	CodeCode Available	1	5
A Personalized Dense Retrieval Framework for Unified Information Access	Apr 26, 2023	Information RetrievalQuestion Answering	CodeCode Available	1	5
Frustratingly Easy Label Projection for Cross-lingual Transfer	Nov 28, 2022	Cross-Lingual NERCross-Lingual Transfer	CodeCode Available	1	5
KELM: Knowledge Enhanced Pre-Trained Language Representations with Message Passing on Hierarchical Relational Graphs	Sep 9, 2021	Common Sense ReasoningLanguage Modelling	CodeCode Available	1	5
CLTR: An End-to-End, Transformer-Based System for Cell Level Table Retrieval and Table Question Answering	Jun 8, 2021	Question AnsweringRetrieval	CodeCode Available	1	5
Fusing Context Into Knowledge Graph for Commonsense Question Answering	Dec 9, 2020	Common Sense ReasoningKnowledge Graphs	CodeCode Available	1	5
KBQA-o1: Agentic Knowledge Base Question Answering with Monte Carlo Tree Search	Jan 31, 2025	Heuristic SearchKnowledge Base Question Answering	CodeCode Available	1	5
KETM:A Knowledge-Enhanced Text Matching method	Aug 11, 2023	Common Sense ReasoningQuestion Answering	CodeCode Available	1	5
Closed Loop Neural-Symbolic Learning via Integrating Neural Perception, Grammar Parsing, and Symbolic Reasoning	Jun 11, 2020	Question AnsweringReinforcement Learning (RL)	CodeCode Available	1	5
Clover: Towards A Unified Video-Language Alignment and Fusion Model	Jul 16, 2022	Language ModelingLanguage Modelling	CodeCode Available	1	5

Show:10 25 50

← PrevPage 34 of 217Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified