Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 591–600 of 10817 papers

Title	Date	Tasks	Status	Hype
VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models	May 23, 2025	Question AnsweringVisual Question Answering	CodeCode Available	1
MetaGen Blended RAG: Higher Accuracy for Domain-Specific Q&A Without Fine-Tuning	May 23, 2025	Few-Shot LearningQuestion Answering	CodeCode Available	1
Benchmarking Retrieval-Augmented Multimomal Generation for Document Question Answering	May 22, 2025	BenchmarkingEvidence Selection	CodeCode Available	1
Mitigating Hallucinations in Vision-Language Models through Image-Guided Head Suppression	May 22, 2025	HallucinationImage Description	CodeCode Available	1
Teaching Large Language Models to Maintain Contextual Faithfulness via Synthetic Tasks and Reinforcement Learning	May 22, 2025	FormQuestion Answering	CodeCode Available	1
O^2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering	May 22, 2025	Answer GenerationOpen-Ended Question Answering	CodeCode Available	1
HopWeaver: Synthesizing Authentic Multi-Hop Questions Across Text Corpora	May 21, 2025	Multi-hop Question AnsweringQuestion Answering	CodeCode Available	1
The Atlas of In-Context Learning: How Attention Heads Shape In-Context Retrieval Augmentation	May 21, 2025	Answer GenerationIn-Context Learning	CodeCode Available	1
From Problem-Solving to Teaching Problem-Solving: Aligning LLMs with Pedagogy using Reinforcement Learning	May 21, 2025	Question AnsweringReinforcement Learning (RL)	CodeCode Available	1
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?	May 19, 2025	Logical ReasoningOptical Character Recognition	CodeCode Available	1

Show:10 25 50

← PrevPage 60 of 1082Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified