Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 5876–5900 of 10817 papers

Title	Date	Tasks	Status
Bend but Don't Break? Multi-Challenge Stress Test for QA Models	Nov 1, 2019	Question Answering	—Unverified
Learning to Solve Geometry Problems from Natural Language Demonstrations in Textbooks	Aug 1, 2017	Question Answering	—Unverified
Learning to Select the Relevant History Turns in Conversational Question Answering	Aug 4, 2023	Binary ClassificationConversational Question Answering	—Unverified
Learning to Select Question-Relevant Relations for Visual Question Answering	Jun 1, 2021	Graph AttentionQuestion Answering	—Unverified
Diverse Multi-Answer Retrieval with Determinantal Point Processes	Nov 29, 2022	Open-Domain Question AnsweringPoint Processes	—Unverified
Benchmarks for Pirá 2.0, a Reading Comprehension Dataset about the Ocean, the Brazilian Coast, and Climate Change	Sep 19, 2023	Generative Question AnsweringInformation Retrieval	—Unverified
LLMs to Support a Domain Specific Knowledge Assistant	Feb 6, 2025	ChatbotMultiple-choice	—Unverified
An Intelligent Question Answering System based on Power Knowledge Graph	Jun 16, 2021	Question Answering	—Unverified
Learning to Selectively Transfer: Reinforced Transfer Learning for Deep Text Matching	Dec 30, 2018	Information RetrievalNatural Language Inference	—Unverified
Diverse and Non-redundant Answer Set Extraction on Community QA based on DPPs	Nov 18, 2020	Point ProcessesQuestion Answering	—Unverified
Benchmarking Vision Language Models for Cultural Understanding	Jul 15, 2024	BenchmarkingQuestion Answering	—Unverified
Ditch the Gold Standard: Re-evaluating Conversational Question Answering	Oct 16, 2021	Conversational Question AnsweringQuestion Answering	—Unverified
Learning to Rehearse in Long Sequence Memorization	Jun 2, 2021	MemorizationQuestion Answering	—Unverified
LMSim : Computing Domain-specific Semantic Word Similarities Using a Language Modeling Approach	Dec 1, 2014	Information RetrievalLanguage Modeling	—Unverified
Learning to Recover Reasoning Chains for Multi-Hop Question Answering via Cooperative Games	Apr 6, 2020	Multi-hop Question AnsweringQuestion Answering	—Unverified
Distributional Inclusion Vector Embedding for Unsupervised Hypernymy Detection	Oct 2, 2017	Hypernym DiscoveryQuestion Answering	—Unverified
An Initial Investigation of Non-Native Spoken Question-Answering	Jul 9, 2021	Question AnsweringReading Comprehension	—Unverified
Aesthetic Visual Question Answering of Photographs	Aug 10, 2022	Question AnsweringSentiment Analysis	—Unverified
Localize, Group, and Select: Boosting Text-VQA by Scene Text Modeling	Aug 20, 2021	Data AblationOptical Character Recognition	—Unverified
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task	Apr 24, 2025	Question AnsweringRetrieval	—Unverified
Localizing AI: Evaluating Open-Weight Language Models for Languages of Baltic States	Jan 7, 2025	Machine TranslationMultiple-choice	—Unverified
Learning to Recognize the Unseen Visual Predicates	Sep 25, 2019	Question AnsweringVisual Question Answering	—Unverified
Neural Reasoning, Fast and Slow, for Video Question Answering	Jul 10, 2019	Natural QuestionsQuestion Answering	—Unverified
Learning to Reason Over Time: Timeline Self-Reflection for Improved Temporal Reasoning in Language Models	Apr 7, 2025	Question AnsweringScheduling	—Unverified
Learning to Reason Iteratively and Parallelly for Complex Visual Reasoning Scenarios	Nov 20, 2024	Question AnsweringVisual Question Answering (VQA)	—Unverified

Show:10 25 50

← PrevPage 236 of 433Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified