Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 4501–4525 of 10817 papers

Title	Date	Tasks	Status
Self-Improvement Programming for Temporal Knowledge Graph Question Answering	Apr 2, 2024	Graph Question AnsweringIn-Context Learning	—Unverified
Stable Code Technical Report	Apr 1, 2024	Code CompletionLanguage Modelling	—Unverified
Unveiling Divergent Inductive Biases of LLMs on Temporal Data	Apr 1, 2024	Inductive BiasNatural Language Inference	CodeCode Available
Detect2Interact: Localizing Object Key Field in Visual Question Answering (VQA) with LLMs	Apr 1, 2024	Common Sense ReasoningObject	—Unverified
Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning	Apr 1, 2024	Image CaptioningInstruction Following	CodeCode Available
VideoDistill: Language-aware Vision Distillation for Video Question Answering	Apr 1, 2024	Answer GenerationQuestion Answering	—Unverified
Explainable Multi-hop Question Generation: An End-to-End Approach without Intermediate Question Labeling	Mar 31, 2024	Question AnsweringQuestion Generation	CodeCode Available
Small Language Models Learn Enhanced Reasoning Skills from Medical Textbooks	Mar 30, 2024	Few-Shot LearningInstruction Following	—Unverified
DOCMASTER: A Unified Platform for Annotation, Training, & Inference in Document Question-Answering	Mar 30, 2024	Privacy PreservingQuestion Answering	—Unverified
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training	Mar 30, 2024	Contrastive LearningQuestion Answering	CodeCode Available
How Robust are the Tabular QA Models for Scientific Tables? A Study using Customized Dataset	Mar 30, 2024	Question Answering	CodeCode Available
Multi-hop Question Answering under Temporal Knowledge Editing	Mar 30, 2024	knowledge editingMulti-hop Question Answering	—Unverified
MANGO: A Benchmark for Evaluating Mapping and Navigation Abilities of Large Language Models	Mar 29, 2024	Language ModelingLanguage Modelling	CodeCode Available
Uncovering Bias in Large Vision-Language Models with Counterfactuals	Mar 29, 2024	counterfactualQuestion Answering	—Unverified
Are Large Language Models Good at Utility Judgments?	Mar 28, 2024	Answer GenerationBenchmarking	CodeCode Available
Leveraging Expert Input for Robust and Explainable AI-Assisted Lung Cancer Detection in Chest X-rays	Mar 28, 2024	Binary ClassificationDecision Making	—Unverified
EthioMT: Parallel Corpus for Low-resource Ethiopian Languages	Mar 28, 2024	Machine TranslationNews Classification	—Unverified
MFORT-QA: Multi-hop Few-shot Open Rich Table Question Answering	Mar 28, 2024	Few-Shot LearningQuestion Answering	—Unverified
Reshaping Free-Text Radiology Notes Into Structured Reports With Generative Transformers	Mar 27, 2024	Generative Question AnsweringInformation Retrieval	CodeCode Available
Boosting Conversational Question Answering with Fine-Grained Retrieval-Augmentation and Self-Check	Mar 27, 2024	Conversational Question AnsweringQuestion Answering	—Unverified
mALBERT: Is a Compact Multilingual BERT Model Still Worth It?	Mar 27, 2024	Language ModelingLanguage Modelling	—Unverified
Chain-of-Action: Faithful and Multimodal Question Answering through Large Language Models	Mar 26, 2024	HallucinationInformation Retrieval	CodeCode Available
Can multiple-choice questions really be useful in detecting the abilities of LLMs?	Mar 26, 2024	Multiple-choiceQuestion Answering	CodeCode Available
Intrinsic Subgraph Generation for Interpretable Graph based Visual Question Answering	Mar 26, 2024	Decision MakingExplainable artificial intelligence	CodeCode Available
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions	Mar 26, 2024	Gaze Target EstimationQuestion Answering	—Unverified

Show:10 25 50

← PrevPage 181 of 433Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified