Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 7901–7950 of 10817 papers

Title	Date	Tasks	Status
Investigating Data Contamination in Modern Benchmarks for Large Language Models	Nov 16, 2023	Common Sense ReasoningMMLU	—Unverified
Question-to-Question Retrieval for Hallucination-Free Knowledge Access: An Approach for Wikipedia and Wikidata Question Answering	Jan 20, 2025	Answer GenerationComputational Efficiency	—Unverified
CT2C-QA: Multimodal Question Answering over Chinese Text, Table and Chart	Oct 28, 2024	Question Answering	—Unverified
Quick and (not so) Dirty: Unsupervised Selection of Justification Sentences for Multi-hop Question Answering	Nov 17, 2019	ARCInformation Retrieval	—Unverified
Investigating Biases in Textual Entailment Datasets	Jun 23, 2019	BIG-bench Machine LearningNatural Language Inference	—Unverified
Investigating Answerability of LLMs for Long-Form Question Answering	Sep 15, 2023	FormLong Form Question Answering	—Unverified
CS-VQA: Visual Question Answering with Compressively Sensed Images	Jun 8, 2018	Question AnsweringVisual Question Answering	—Unverified
QUINT: Interpretable Question Answering over Knowledge Bases	Sep 1, 2017	Named Entity Recognition (NER)Question Answering	—Unverified
Automated assessment of knowledge hierarchy evolution: comparing directed acyclic graphs	Jun 1, 2019	Knowledge Graph CompletionKnowledge Graphs	—Unverified
An Augmented Benchmark Dataset for Geometric Question Answering through Dual Parallel Text Encoding	Oct 1, 2022	Data AugmentationMath	—Unverified
Adopting the Word-Pair-Dependency-Triplets with Individual Comparison for Natural Language Inference	Aug 1, 2018	Decision MakingMachine Translation	—Unverified
Investigating and Addressing Hallucinations of LLMs in Tasks Involving Negation	Jun 8, 2024	Abstractive Text SummarizationDialogue Generation	—Unverified
Inverse Visual Question Answering with Multi-Level Attentions	Sep 17, 2019	Question AnsweringVisual Question Answering	—Unverified
QurAna: Corpus of the Quran annotated with Pronominal Anaphora	May 1, 2012	Coreference ResolutionInformation Retrieval	—Unverified
Inverse Visual Question Answering: A New Benchmark and VQA Diagnosis Tool	Mar 16, 2018	Question AnsweringReinforcement Learning	—Unverified
Invar-RAG: Invariant LLM-aligned Retrieval for Better Generation	Nov 11, 2024	HallucinationInformation Retrieval	—Unverified
Automated Answer Validation using Text Similarity	Jan 13, 2024	Information RetrievalMultiple-choice	—Unverified
CSS: Combining Self-training and Self-supervised Learning for Few-shot Dialogue State Tracking	Oct 11, 2022	Dialogue State TrackingMachine Reading Comprehension	—Unverified
Introduction to Neural Network based Approaches for Question Answering over Knowledge Graphs	Jul 22, 2019	Knowledge GraphsQuestion Answering	—Unverified
R3: A Reading Comprehension Benchmark Requiring Reasoning Processes	Apr 2, 2020	Question AnsweringReading Comprehension	—Unverified
R3 : Refined Retriever-Reader pipeline for Multidoc2dial	May 1, 2022	Conversational Question AnsweringDecoder	—Unverified
Introduction of a Probabilistic Language Model to Non-Factoid Question Answering Using Example Q\&A Pairs	Nov 1, 2012	Language ModelingLanguage Modelling	—Unverified
R4: Reinforced Retriever-Reorder-Responder for Retrieval-Augmented Large Language Models	May 4, 2024	Graph AttentionHallucination	—Unverified
RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training	Oct 18, 2024	DenoisingQuestion Answering	—Unverified
CSReader at SemEval-2018 Task 11: Multiple Choice Question Answering as Textual Entailment	Jun 1, 2018	Common Sense ReasoningLanguage Modelling	—Unverified
AutoKnow: Self-Driving Knowledge Collection for Products of Thousands of Types	Jun 24, 2020	Anomaly DetectionKnowledge Graphs	—Unverified
An Audio-enriched BERT-based Framework for Spoken Multiple-choice Question Answering	May 25, 2020	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Introduction method for argumentative dialogue using paired question-answering interchange about personality	Jul 1, 2018	Decision MakingQuestion Answering	—Unverified
Introducing Semantics into Speech Encoders	Nov 15, 2022	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Introducing RezoJDM16k: a French KnowledgeGraph DataSet for Link Prediction	Jun 1, 2022	16kBenchmarking	—Unverified
CS-NLP team at SemEval-2020 Task 4: Evaluation of State-of-the-art NLP Deep Learning Architectures on Commonsense Reasoning Task	May 17, 2020	Multiple-choiceNatural Language Inference	—Unverified
RAG based Question-Answering for Contextual Response Prediction System	Sep 5, 2024	PredictionQuestion Answering	—Unverified
Introducing "Forecast Utterance" for Conversational Data Science	Sep 7, 2023	PredictionQuestion Answering	—Unverified
CSE-SFP: Enabling Unsupervised Sentence Representation Learning via a Single Forward Pass	May 1, 2025	Contrastive LearningInformation Retrieval	—Unverified
Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis	Jul 21, 2024	Question AnsweringText Generation	—Unverified
CSAT‑FTCN: A Fuzzy‑Oriented Model with Contextual Self‑attention Network for Multimodal Emotion Recognition	Jan 31, 2023	Emotion RecognitionMultimodal Emotion Recognition	—Unverified
AUTOHOME-ORCA at SemEval-2019 Task 8: Application of BERT for Fact-Checking in Community Forums	Jun 1, 2019	Community Question AnsweringFact Checking	—Unverified
A Natural Language Instructor for pedestrian navigation based in generation by selection	Apr 1, 2014	Question AnsweringText Generation	—Unverified
RAG-RL: Advancing Retrieval-Augmented Generation via RL and Curriculum Learning	Mar 17, 2025	Answer GenerationMulti-hop Question Answering	—Unverified
A Domain and Language Independent Named Entity Classification Approach Based on Profiles and Local Information	Sep 1, 2017	General ClassificationNamed Entity Recognition (NER)	—Unverified
A Coarse to Fine Question Answering System based on Reinforcement Learning	Jun 1, 2021	Deep Reinforcement LearningQuestion Answering	—Unverified
Examining Long-Context Large Language Models for Environmental Review Document Comprehension	Jul 10, 2024	Question AnsweringRAG	—Unverified
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos	Jun 12, 2025	Question Answering	—Unverified
Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts	Feb 26, 2024	DiversityQuestion Answering	—Unverified
In-the-Wild Video Question Answering	Oct 1, 2022	Evidence SelectionQuestion Answering	—Unverified
Inter-Weighted Alignment Network for Sentence Pair Modeling	Sep 1, 2017	Machine TranslationNatural Language Inference	—Unverified
Interpreting Questions with a Log-Linear Ranking Model in a Virtual Patient Dialogue System	Jun 1, 2015	Question AnsweringSemantic Parsing	—Unverified
CS563-QA: A Collection for Evaluating Question Answering Systems	Jul 2, 2019	Natural Language UnderstandingQuestion Answering	—Unverified
Interpreting Consumer Health Questions: The Role of Anaphora and Ellipsis	Aug 1, 2013	Information RetrievalQuestion Answering	—Unverified
Interpreting Attention Models with Human Visual Attention in Machine Reading Comprehension	Jun 3, 2020	Machine Reading ComprehensionQuestion Answering	—Unverified

Show:10 25 50

← PrevPage 159 of 217Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified