Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2411–2420 of 10817 papers

Title	Date	Tasks	Status
A Robustly Optimized BERT Pre-training Approach with Post-training	Aug 1, 2021	Extractive Question-AnsweringQuestion Answering	—Unverified
A Road-map Towards Explainable Question Answering A Solution for Information Pollution	Jul 4, 2019	PositionQuestion Answering	—Unverified
Adapting Large Language Models for Multi-Domain Retrieval-Augmented-Generation	Apr 3, 2025	Domain GeneralizationQuestion Answering	—Unverified
DLS@CU at SemEval-2016 Task 1: Supervised Models of Sentence Similarity	Jun 1, 2016	Machine TranslationNatural Language Inference	—Unverified
CHOPT : Automated Hyperparameter Optimization Framework for Cloud-Based Machine Learning Platforms	Oct 8, 2018	BIG-bench Machine LearningHyperparameter Optimization	—Unverified
Adapting Large Language Models for Education: Foundational Capabilities, Potentials, and Challenges	Dec 27, 2023	Question Answering	—Unverified
Chop Chop BERT: Visual Question Answering by Chopping VisualBERT's Heads	Apr 30, 2021	Question AnsweringVisual Question Answering	—Unverified
Choosing which to use? A study of distributional models for nominal lexical semantic classification	May 1, 2014	General ClassificationMachine Translation	—Unverified
SAGE: A Framework of Precise Retrieval for RAG	Mar 3, 2025	Question AnsweringRAG	—Unverified
DLS@CU-CORE: A Simple Machine Learning Model of Semantic Textual Similarity	Jun 1, 2013	BIG-bench Machine LearningInformation Retrieval	—Unverified

Show:10 25 50

← PrevPage 242 of 1082Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified