Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1551–1575 of 10817 papers

Title	Date	Tasks	Status	Hype	Score
Interactive Grounded Language Acquisition and Generalization in a 2D World	Jan 31, 2018	Language AcquisitionQuestion Answering	CodeCode Available	1	5
Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language Models	Mar 24, 2023	Machine TranslationNatural Language Understanding	CodeCode Available	1	5
Interconnected Question Generation with Coreference Alignment and Conversation Flow Modeling	Jun 17, 2019	Question AnsweringQuestion Generation	CodeCode Available	1	5
Towards General Natural Language Understanding with Probabilistic Worldbuilding	May 6, 2021	Natural Language UnderstandingQuestion Answering	CodeCode Available	1	5
InsQABench: Benchmarking Chinese Insurance Domain Question Answering with Large Language Models	Jan 19, 2025	BenchmarkingQuestion Answering	CodeCode Available	1	5
Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering	Mar 21, 2024	object-detectionObject Detection	CodeCode Available	1	5
Answering Complex Open-Domain Questions with Multi-Hop Dense Retrieval	Sep 27, 2020	Question AnsweringRetrieval	CodeCode Available	1	5
Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks	Apr 23, 2024	Mathematical Problem-SolvingQuestion Answering	CodeCode Available	1	5
INSCIT: Information-Seeking Conversations with Mixed-Initiative Interactions	Jul 2, 2022	Open-Domain Question AnsweringQuestion Answering	CodeCode Available	1	5
Block Pruning For Faster Transformers	Sep 10, 2021	Machine TranslationQuestion Answering	CodeCode Available	1	5
Injecting Numerical Reasoning Skills into Language Models	Apr 9, 2020	Data AugmentationDecoder	CodeCode Available	1	5
ETC: Encoding Long and Structured Inputs in Transformers	Apr 17, 2020	PositionQuestion Answering	CodeCode Available	1	5
INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection	Feb 6, 2024	DiversityHallucination	CodeCode Available	1	5
Multi-granularity Temporal Question Answering over Knowledge Graphs	Jul 9, 2023	Knowledge GraphsQuestion Answering	CodeCode Available	1	5
Multi-Modal Answer Validation for Knowledge-Based VQA	Mar 23, 2021	Question AnsweringRetrieval	CodeCode Available	1	5
Multimodal ChatGPT for Medical Applications: an Experimental Study of GPT-4V	Oct 29, 2023	DiagnosticLanguage Modeling	CodeCode Available	1	5
InstructionGPT-4: A 200-Instruction Paradigm for Fine-Tuning MiniGPT-4	Aug 23, 2023	Instruction FollowingQuestion Answering	CodeCode Available	1	5
Evaluating Entity Disambiguation and the Role of Popularity in Retrieval-Based NLP	Jun 12, 2021	Entity DisambiguationEntity Retrieval	CodeCode Available	1	5
-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation	Jan 31, 2025	Question AnsweringVideo Question Answering	CodeCode Available	1	5
Clues Before Answers: Generation-Enhanced Multiple-Choice QA	Apr 30, 2022	DecoderMultiple-choice	CodeCode Available	1	5
Agentic Keyframe Search for Video Question Answering	Mar 20, 2025	EgoSchemaQuestion Answering	CodeCode Available	1	5
BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions	May 24, 2019	Question AnsweringReading Comprehension	CodeCode Available	1	5
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues	Jul 30, 2024	Audio-visual Question AnsweringAudio-Visual Question Answering (AVQA)	CodeCode Available	1	5
Evaluating language models as risk scores	Jul 19, 2024	Multiple-choiceQuestion Answering	CodeCode Available	1	5
Infusing Disease Knowledge into BERT for Health Question Answering, Medical Inference and Disease Name Recognition	Oct 8, 2020	Question AnsweringWorld Knowledge	CodeCode Available	1	5

Show:10 25 50

← PrevPage 63 of 433Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified