Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 2751–2800 of 10817 papers

Title	Date	Tasks	Status
Self-ReS: Self-Reflection in Large Vision-Language Models for Long Video Understanding	Mar 26, 2025	GPUQuestion Answering	—Unverified
A Survey of Multimodal Retrieval-Augmented Generation	Mar 26, 2025	Information RetrievalQuestion Answering	—Unverified
Feature4X: Bridging Any Monocular Video to 4D Agentic AI with Versatile Gaussian Feature Fields	Mar 26, 2025	Question AnsweringVisual Question Answering	—Unverified
VGAT: A Cancer Survival Analysis Framework Transitioning from Generative Visual Question Answering to Genomic Reconstruction	Mar 25, 2025	Generative Visual Question AnsweringQuestion Answering	CodeCode Available
Can Vision-Language Models Answer Face to Face Questions in the Real-World?	Mar 25, 2025	Question Answering	—Unverified
DomainCQA: Crafting Expert-Level QA from Domain-Specific Charts	Mar 25, 2025	AstronomyChart Question Answering	—Unverified
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation	Mar 25, 2025	Action GenerationAutonomous Driving	—Unverified
VectorFit : Adaptive Singular & Bias Vector Fine-Tuning of Pre-trained Foundation Models	Mar 25, 2025	image-classificationImage Classification	—Unverified
BiblioPage: A Dataset of Scanned Title Pages for Bibliographic Metadata Extraction	Mar 25, 2025	document understandingobject-detection	CodeCode Available
DeCAP: Context-Adaptive Prompt Generation for Debiasing Zero-shot Question Answering in Large Language Models	Mar 25, 2025	FairnessQuestion Answering	—Unverified
Improved Alignment of Modalities in Large Vision Language Models	Mar 25, 2025	GPUImage Captioning	—Unverified
KSHSeek: Data-Driven Approaches to Mitigating and Detecting Knowledge-Shortcut Hallucinations in Generative Models	Mar 25, 2025	HallucinationQuestion Answering	—Unverified
ImF: Implicit Fingerprint for Large Language Models	Mar 25, 2025	Adversarial AttackQuestion Answering	—Unverified
Context-Efficient Retrieval with Factual Decomposition	Mar 25, 2025	FormInformation Retrieval	—Unverified
LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?	Mar 25, 2025	Autonomous NavigationQuestion Answering	—Unverified
Open-Vocabulary Functional 3D Scene Graphs for Real-World Indoor Spaces	Mar 24, 2025	Question Answering	—Unverified
DiN: Diffusion Model for Robust Medical VQA with Semantic Noisy Labels	Mar 24, 2025	Medical Visual Question AnsweringQuestion Answering	—Unverified
Synthetic Function Demonstrations Improve Generation in Low-Resource Programming Languages	Mar 24, 2025	Question AnsweringRAG	—Unverified
Where is this coming from? Making groundedness count in the evaluation of Document VQA models	Mar 24, 2025	Question AnsweringVisual Question Answering	—Unverified
MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering	Mar 24, 2025	Graph Neural NetworkQuestion Answering	—Unverified
A Survey of Large Language Model Agents for Question Answering	Mar 24, 2025	Answer GenerationInformation Retrieval	—Unverified
When is dataset cartography ineffective? Using training dynamics does not improve robustness against Adversarial SQuAD	Mar 24, 2025	Adversarial RobustnessExtractive Question-Answering	—Unverified
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models	Mar 23, 2025	Question AnsweringVisual Question Answering	—Unverified
SUNAR: Semantic Uncertainty based Neighborhood Aware Retrieval for Complex QA	Mar 23, 2025	Question AnsweringRetrieval	—Unverified
SLIDE: Sliding Localized Information for Document Extraction	Mar 23, 2025	Chunkinggraph construction	—Unverified
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering	Mar 23, 2025	BenchmarkingChart Question Answering	—Unverified
Progressive Prompt Detailing for Improved Alignment in Text-to-Image Generative Models	Mar 22, 2025	Question AnsweringVisual Question Answering	CodeCode Available
Relation Extraction with Instance-Adapted Predicate Descriptions	Mar 22, 2025	DecoderQuestion Answering	CodeCode Available
4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding	Mar 22, 2025	BenchmarkingObject	CodeCode Available
Does Chain-of-Thought Reasoning Help Mobile GUI Agent? An Empirical Study	Mar 21, 2025	AttributeMathematical Problem-Solving	CodeCode Available
MARS: A Multi-Agent Framework Incorporating Socratic Guidance for Automated Prompt Optimization	Mar 21, 2025	Question Answering	—Unverified
Dense Passage Retrieval in Conversational Search	Mar 21, 2025	Conversational SearchInformation Retrieval	CodeCode Available
A Study into Investigating Temporal Robustness of LLMs	Mar 21, 2025	Question AnsweringWorld Knowledge	—Unverified
PVChat: Personalized Video Chat with One-Shot Learning	Mar 21, 2025	One-Shot LearningQuestion Answering	—Unverified
Typed-RAG: Type-aware Multi-Aspect Decomposition for Non-Factoid Question Answering	Mar 20, 2025	Question AnsweringRAG	CodeCode Available
ECKGBench: Benchmarking Large Language Models in E-commerce Leveraging Knowledge Graph	Mar 20, 2025	BenchmarkingHallucination	—Unverified
Bridging Technology and Humanities: Evaluating the Impact of Large Language Models on Social Sciences Research with DeepSeek-R1	Mar 20, 2025	Large Language ModelLogical Reasoning	—Unverified
Big Help or Big Brother? Auditing Tracking, Profiling, and Personalization in Generative AI Assistants	Mar 20, 2025	Question Answering	—Unverified
A Vision Centric Remote Sensing Benchmark	Mar 20, 2025	Question AnsweringRepresentation Learning	—Unverified
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering	Mar 20, 2025	Contrastive LearningQuestion Answering	—Unverified
AutoDrive-QA- Automated Generation of Multiple-Choice Questions for Autonomous Driving Datasets Using Large Vision-Language Models	Mar 20, 2025	Autonomous DrivingMultiple-choice	—Unverified
GraspCoT: Integrating Physical Property Reasoning for 6-DoF Grasping under Flexible Language Instructions	Mar 20, 2025	Question Answering	—Unverified
MKG-Rank: Enhancing Large Language Models with Knowledge Graph for Multilingual Medical Question Answering	Mar 20, 2025	Knowledge GraphsMedical Question Answering	—Unverified
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models	Mar 20, 2025	DiagnosticMedical Image Analysis	CodeCode Available
UPME: An Unsupervised Peer Review Framework for Multimodal Large Language Model Evaluation	Mar 19, 2025	Language Model EvaluationLanguage Modeling	—Unverified
Bias Evaluation and Mitigation in Retrieval-Augmented Medical Question-Answering Systems	Mar 19, 2025	counterfactualDecision Making	—Unverified
MAMM-Refine: A Recipe for Improving Faithfulness in Generation with Multi-Agent Collaboration	Mar 19, 2025	Long Form Question AnsweringQuestion Answering	—Unverified
Solla: Towards a Speech-Oriented LLM That Hears Acoustic Context	Mar 19, 2025	Audio captioningAudio Question Answering	CodeCode Available
EfficientLLaVA:Generalizable Auto-Pruning for Large Vision-language Models	Mar 19, 2025	MM-VetMultimodal Reasoning	—Unverified
TruthLens:A Training-Free Paradigm for DeepFake Detection	Mar 19, 2025	Binary ClassificationDeepFake Detection	—Unverified

Show:10 25 50

← PrevPage 56 of 217Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified