Question Answering

Question answering can be segmented into domain-specific tasks like community question answering and knowledge-base question answering. Popular benchmark datasets for evaluation question answering systems include SQuAD, HotPotQA, bAbI, TriviaQA, WikiQA, and many others. Models for question answering are typically evaluated on metrics like EM and F1. Some recent top performing models are T5 and XLNet.

( Image credit: SQuAD )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 4501–4550 of 10817 papers

Title	Date	Tasks	Status
Helmsman of the Masses? Evaluate the Opinion Leadership of Large Language Models in the Werewolf Game	Apr 2, 2024	Question Answering	CodeCode Available
Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning	Apr 1, 2024	Image CaptioningInstruction Following	CodeCode Available
Stable Code Technical Report	Apr 1, 2024	Code CompletionLanguage Modelling	—Unverified
VideoDistill: Language-aware Vision Distillation for Video Question Answering	Apr 1, 2024	Answer GenerationQuestion Answering	—Unverified
Detect2Interact: Localizing Object Key Field in Visual Question Answering (VQA) with LLMs	Apr 1, 2024	Common Sense ReasoningObject	—Unverified
Unveiling Divergent Inductive Biases of LLMs on Temporal Data	Apr 1, 2024	Inductive BiasNatural Language Inference	CodeCode Available
Explainable Multi-hop Question Generation: An End-to-End Approach without Intermediate Question Labeling	Mar 31, 2024	Question AnsweringQuestion Generation	CodeCode Available
Small Language Models Learn Enhanced Reasoning Skills from Medical Textbooks	Mar 30, 2024	Few-Shot LearningInstruction Following	—Unverified
How Robust are the Tabular QA Models for Scientific Tables? A Study using Customized Dataset	Mar 30, 2024	Question Answering	CodeCode Available
Multi-hop Question Answering under Temporal Knowledge Editing	Mar 30, 2024	knowledge editingMulti-hop Question Answering	—Unverified
DOCMASTER: A Unified Platform for Annotation, Training, & Inference in Document Question-Answering	Mar 30, 2024	Privacy PreservingQuestion Answering	—Unverified
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training	Mar 30, 2024	Contrastive LearningQuestion Answering	CodeCode Available
Uncovering Bias in Large Vision-Language Models with Counterfactuals	Mar 29, 2024	counterfactualQuestion Answering	—Unverified
MANGO: A Benchmark for Evaluating Mapping and Navigation Abilities of Large Language Models	Mar 29, 2024	Language ModelingLanguage Modelling	CodeCode Available
Leveraging Expert Input for Robust and Explainable AI-Assisted Lung Cancer Detection in Chest X-rays	Mar 28, 2024	Binary ClassificationDecision Making	—Unverified
Are Large Language Models Good at Utility Judgments?	Mar 28, 2024	Answer GenerationBenchmarking	CodeCode Available
EthioMT: Parallel Corpus for Low-resource Ethiopian Languages	Mar 28, 2024	Machine TranslationNews Classification	—Unverified
MFORT-QA: Multi-hop Few-shot Open Rich Table Question Answering	Mar 28, 2024	Few-Shot LearningQuestion Answering	—Unverified
Boosting Conversational Question Answering with Fine-Grained Retrieval-Augmentation and Self-Check	Mar 27, 2024	Conversational Question AnsweringQuestion Answering	—Unverified
mALBERT: Is a Compact Multilingual BERT Model Still Worth It?	Mar 27, 2024	Language ModelingLanguage Modelling	—Unverified
Reshaping Free-Text Radiology Notes Into Structured Reports With Generative Transformers	Mar 27, 2024	Generative Question AnsweringInformation Retrieval	CodeCode Available
Chain-of-Action: Faithful and Multimodal Question Answering through Large Language Models	Mar 26, 2024	HallucinationInformation Retrieval	CodeCode Available
Can multiple-choice questions really be useful in detecting the abilities of LLMs?	Mar 26, 2024	Multiple-choiceQuestion Answering	CodeCode Available
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions	Mar 26, 2024	Gaze Target EstimationQuestion Answering	—Unverified
Denoising Table-Text Retrieval for Open-Domain Question Answering	Mar 26, 2024	DenoisingOpen-Domain Question Answering	CodeCode Available
Visual Hallucination: Definition, Quantification, and Prescriptive Remediations	Mar 26, 2024	HallucinationImage Captioning	—Unverified
GPTs and Language Barrier: A Cross-Lingual Legal QA Examination	Mar 26, 2024	ArticlesBenchmarking	—Unverified
Intrinsic Subgraph Generation for Interpretable Graph based Visual Question Answering	Mar 26, 2024	Decision MakingExplainable artificial intelligence	CodeCode Available
Make-It-Vivid: Dressing Your Animatable Biped Cartoon Characters from Text	Mar 25, 2024	Question AnsweringTexture Synthesis	—Unverified
Task-Agnostic Detector for Insertion-Based Backdoor Attacks	Mar 25, 2024	named-entity-recognitionNamed Entity Recognition	—Unverified
ProCQA: A Large-scale Community-based Programming Question Answering Dataset for Code Search	Mar 25, 2024	Code SearchQuestion Answering	CodeCode Available
PropTest: Automatic Property Testing for Improved Visual Programming	Mar 25, 2024	Question AnsweringReferring Expression	—Unverified
Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA	Mar 25, 2024	Chart Question AnsweringData Augmentation	—Unverified
CBT-LLM: A Chinese Large Language Model for Cognitive Behavioral Therapy-based Mental Health Question Answering	Mar 24, 2024	Language ModelingLanguage Modelling	—Unverified
Improving Retrieval for RAG based Question Answering Models on Financial Documents	Mar 23, 2024	ChunkingQuestion Answering	—Unverified
Explore until Confident: Efficient Exploration for Embodied Question Answering	Mar 23, 2024	Conformal PredictionEfficient Exploration	—Unverified
MRC-based Nested Medical NER with Co-prediction and Adaptive Pre-training	Mar 23, 2024	Knowledge GraphsMachine Reading Comprehension	—Unverified
General LLMs as Instructors for Domain-Specific LLMs: A Sequential Fusion Method to Integrate Extraction and Editing	Mar 23, 2024	knowledge editingKnowledge Graphs	—Unverified
Awakening Augmented Generation: Learning to Awaken Internal Knowledge of Large Language Models for Question Answering	Mar 22, 2024	Open-Domain Question AnsweringOut-of-Distribution Generalization	CodeCode Available
Multi-Review Fusion-in-Context	Mar 22, 2024	Long Form Question AnsweringQuestion Answering	—Unverified
Sphere Neural-Networks for Rational Reasoning	Mar 22, 2024	HallucinationLogical Reasoning	—Unverified
Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery	Mar 22, 2024	Language ModelingLanguage Modelling	—Unverified
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels	Mar 21, 2024	Multi-Label ClassificationMUlTI-LABEL-ClASSIFICATION	—Unverified
FIT-RAG: Black-Box RAG with Factual Information and Token Reduction	Mar 21, 2024	Open-Domain Question AnsweringQuestion Answering	—Unverified
Extracting Emotion Phrases from Tweets using BART	Mar 21, 2024	Question AnsweringSentiment Analysis	—Unverified
Large Language Models for Multi-Choice Question Classification of Medical Subjects	Mar 21, 2024	Multi-class ClassificationQuestion Answering	—Unverified
Multi-Level Explanations for Generative Language Models	Mar 21, 2024	Question Answeringtext-classification	—Unverified
MyVLM: Personalizing VLMs for User-Specific Queries	Mar 21, 2024	Image CaptioningLanguage Modelling	—Unverified
Context Quality Matters in Training Fusion-in-Decoder for Extractive Open-Domain Question Answering	Mar 21, 2024	DecoderLanguage Modeling	—Unverified
gTBLS: Generating Tables from Text by Conditional Question Answering	Mar 21, 2024	Language ModelingLanguage Modelling	—Unverified

Show:10 25 50

← PrevPage 91 of 217Next →

All datasets SQuAD2.0 SQuAD1.1 HotpotQA PIQA BoolQ COPA TriviaQA SQuAD1.1 dev Natural Questions OpenBookQA TruthfulQA MultiRC

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	IE-Net (ensemble)	EM	90.94	—	Unverified
2	FPNet (ensemble)	EM	90.87	—	Unverified
3	IE-NetV2 (ensemble)	EM	90.86	—	Unverified
4	SA-Net on Albert (ensemble)	EM	90.72	—	Unverified
5	SA-Net-V2 (ensemble)	EM	90.68	—	Unverified
6	FPNet (ensemble)	EM	90.6	—	Unverified
7	Retro-Reader (ensemble)	EM	90.58	—	Unverified
8	EntitySpanFocusV2 (ensemble)	EM	90.52	—	Unverified
9	TransNets + SFVerifier + SFEnsembler (ensemble)	EM	90.49	—	Unverified
10	EntitySpanFocus+AT (ensemble)	EM	90.45	—	Unverified