Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2471–2480 of 10817 papers

Title	Date	Tasks	Status	Hype
MedExQA: Medical Question Answering Benchmark with Multiple Explanations	Jun 10, 2024	Medical Question AnsweringQuestion Answering	CodeCode Available	0
VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text	Jun 10, 2024	Language ModelingLanguage Modelling	CodeCode Available	1
Transforming Wearable Data into Health Insights using Large Language Model Agents	Jun 10, 2024	Code GenerationInformation Retrieval	—Unverified	0
MrRank: Improving Question Answering Retrieval System through Multi-Result Ranking Model	Jun 9, 2024	Information RetrievalLearning-To-Rank	—Unverified	0
MedREQAL: Examining Medical Knowledge Recall of Large Language Models via Question Answering	Jun 9, 2024	Question Answering	—Unverified	0
Zero-Shot End-To-End Spoken Question Answering In Medical Domain	Jun 9, 2024	Answer SelectionQuestion Answering	—Unverified	0
F-LMM: Grounding Frozen Large Multimodal Models	Jun 9, 2024	General KnowledgeInstruction Following	CodeCode Available	2
RE-RAG: Improving Open-Domain QA Performance and Interpretability with Relevance Estimator in Retrieval-Augmented Generation	Jun 9, 2024	Document RankingNatural Questions	CodeCode Available	0
Do LLMs Exhibit Human-Like Reasoning? Evaluating Theory of Mind in LLMs for Open-Ended Responses	Jun 9, 2024	Question AnsweringSemantic Similarity	—Unverified	0
Do LLMs Recognize me, When I is not me: Assessment of LLMs Understanding of Turkish Indexical Pronouns in Indexical Shift Contexts	Jun 8, 2024	Machine TranslationMultiple-choice	—Unverified	0

Show:10 25 50

← PrevPage 248 of 1082Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified