Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 7926–7950 of 10817 papers

Title	Date	Tasks	Status
AutoKnow: Self-Driving Knowledge Collection for Products of Thousands of Types	Jun 24, 2020	Anomaly DetectionKnowledge Graphs	—Unverified
An Audio-enriched BERT-based Framework for Spoken Multiple-choice Question Answering	May 25, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Introduction method for argumentative dialogue using paired question-answering interchange about personality	Jul 1, 2018	Decision MakingQuestion Answering	—Unverified
Introducing Semantics into Speech Encoders	Nov 15, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Introducing RezoJDM16k: a French KnowledgeGraph DataSet for Link Prediction	Jun 1, 2022	16kBenchmarking	—Unverified
CS-NLP team at SemEval-2020 Task 4: Evaluation of State-of-the-art NLP Deep Learning Architectures on Commonsense Reasoning Task	May 17, 2020	Multiple-choiceNatural Language Inference	—Unverified
RAG based Question-Answering for Contextual Response Prediction System	Sep 5, 2024	PredictionQuestion Answering	—Unverified
Introducing "Forecast Utterance" for Conversational Data Science	Sep 7, 2023	PredictionQuestion Answering	—Unverified
CSE-SFP: Enabling Unsupervised Sentence Representation Learning via a Single Forward Pass	May 1, 2025	Contrastive LearningInformation Retrieval	—Unverified
Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis	Jul 21, 2024	Question AnsweringText Generation	—Unverified
CSAT‑FTCN: A Fuzzy‑Oriented Model with Contextual Self‑attention Network for Multimodal Emotion Recognition	Jan 31, 2023	Emotion RecognitionMultimodal Emotion Recognition	—Unverified
AUTOHOME-ORCA at SemEval-2019 Task 8: Application of BERT for Fact-Checking in Community Forums	Jun 1, 2019	Community Question AnsweringFact Checking	—Unverified
A Natural Language Instructor for pedestrian navigation based in generation by selection	Apr 1, 2014	Question AnsweringText Generation	—Unverified
RAG-RL: Advancing Retrieval-Augmented Generation via RL and Curriculum Learning	Mar 17, 2025	Answer GenerationMulti-hop Question Answering	—Unverified
A Domain and Language Independent Named Entity Classification Approach Based on Profiles and Local Information	Sep 1, 2017	General ClassificationNamed Entity Recognition (NER)	—Unverified
A Coarse to Fine Question Answering System based on Reinforcement Learning	Jun 1, 2021	Deep Reinforcement LearningQuestion Answering	—Unverified
Examining Long-Context Large Language Models for Environmental Review Document Comprehension	Jul 10, 2024	Question AnsweringRAG	—Unverified
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos	Jun 12, 2025	Question Answering	—Unverified
Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts	Feb 26, 2024	DiversityQuestion Answering	—Unverified
In-the-Wild Video Question Answering	Oct 1, 2022	Evidence SelectionQuestion Answering	—Unverified
Inter-Weighted Alignment Network for Sentence Pair Modeling	Sep 1, 2017	Machine TranslationNatural Language Inference	—Unverified
Interpreting Questions with a Log-Linear Ranking Model in a Virtual Patient Dialogue System	Jun 1, 2015	Question AnsweringSemantic Parsing	—Unverified
CS563-QA: A Collection for Evaluating Question Answering Systems	Jul 2, 2019	Natural Language UnderstandingQuestion Answering	—Unverified
Interpreting Consumer Health Questions: The Role of Anaphora and Ellipsis	Aug 1, 2013	Information RetrievalQuestion Answering	—Unverified
Interpreting Attention Models with Human Visual Attention in Machine Reading Comprehension	Jun 3, 2020	Machine Reading ComprehensionQuestion Answering	—Unverified

Show:10 25 50

← PrevPage 318 of 433Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified