Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 7476–7500 of 10817 papers

Title	Date	Tasks	Status
Automatic Evaluation of Summary Using Textual Entailment	Sep 1, 2013	Information RetrievalNatural Language Inference	—Unverified
An Emotional Comfort Framework for Improving User Satisfaction in E-Commerce Customer Service Chatbots	Jun 1, 2021	Answer SelectionEmotion Classification	—Unverified
Post-training an LLM for RAG? Train on Self-Generated Demonstrations	Feb 14, 2025	AttributeQuestion Answering	—Unverified
Advancing Chinese biomedical text mining with community challenges	Mar 7, 2024	AttributeAttribute Extraction	—Unverified
A Combined Pattern-based and Distributional Approach for Automatic Hypernym Detection in Dutch.	Sep 1, 2013	Information RetrievalNatural Language Inference	—Unverified
Power in Numbers: Robust reading comprehension by finetuning with four adversarial sentences per example	Jan 18, 2024	Question AnsweringReading Comprehension	—Unverified
Poze: Sports Technique Feedback under Data Constraints	Nov 8, 2024	Pose EstimationQuestion Answering	—Unverified
PPT: A Process-based Preference Learning Framework for Self Improving Table Question Answering Models	May 23, 2025	Code GenerationMathematical Reasoning	—Unverified
(2.5+1)D Spatio-Temporal Scene Graphs for Video Question Answering	Feb 18, 2022	Question AnsweringSpatio-temporal Scene Graphs	—Unverified
MMPKUBase: A Comprehensive and High-quality Chinese Multi-modal Knowledge Graph	Aug 3, 2024	AttributeContrastive Learning	—Unverified
Explainable High-order Visual Question Reasoning: A New Benchmark and Knowledge-routed Network	Sep 23, 2019	Question AnsweringTriplet	—Unverified
1-800-SHARED-TASKS at RegNLP: Lexical Reranking of Semantic Retrieval (LeSeR) for Regulatory Question Answering	Dec 8, 2024	Answer GenerationDomain Adaptation	—Unverified
Practical Parsing for Downstream Applications	Aug 1, 2018	Domain AdaptationQuestion Answering	—Unverified
Joint Learning with Global Inference for Comment Classification in Community Question Answering	Jun 1, 2016	Community Question AnsweringGeneral Classification	—Unverified
Practice in Synonym Extraction at Large Scale	Dec 6, 2014	Question Answering	—Unverified
Joint learning of object graph and relation graph for visual question answering	May 9, 2022	AttributeGraph Neural Network	—Unverified
DataFrame QA: A Universal LLM Framework on DataFrame Question Answering Without Data Exposure	Jan 27, 2024	Information RetrievalQuestion Answering	—Unverified
Joint Learning of Entity Linking Constraints Using a Markov-Logic Network	Mar 1, 2014	Entity LinkingQuestion Answering	—Unverified
Data-efficient Meta-models for Evaluation of Context-based Questions and Answers in LLMs	May 29, 2025	Dimensionality ReductionHallucination	—Unverified
Precise Length Control in Large Language Models	Dec 16, 2024	DecoderDocument Summarization	—Unverified
Precise Model Benchmarking with Only a Few Observations	Oct 7, 2024	Benchmarkingmodel	—Unverified
Precision Empowers, Excess Distracts: Visual Question Answering With Dynamically Infused Knowledge In Language Models	Jun 14, 2024	DecoderKnowledge Graphs	—Unverified
Pre-computed memory or on-the-fly encoding? A hybrid approach to retrieval augmentation makes the most of your compute	Jan 25, 2023	DecoderQuestion Answering	—Unverified
Joint Learning of a Dual SMT System for Paraphrase Generation	Jul 1, 2012	Machine TranslationParaphrase Generation	—Unverified
Joint Information Extraction and Reasoning: A Scalable Statistical Relational Learning Approach	Jul 1, 2015	Entity Extraction using GANMachine Translation	—Unverified

Show:10 25 50

← PrevPage 300 of 433Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified