Reading Comprehension

Most current question answering datasets frame the task as reading comprehension where the question is about a paragraph or document and the answer often is a span in the document.

Some specific tasks of reading comprehension include multi-modal machine reading comprehension and textual machine reading comprehension, among others. In the literature, machine reading comprehension can be divide into four categories: cloze style, multiple choice, span prediction, and free-form answer. Read more about each category here.

Benchmark datasets used for testing a model's reading comprehension abilities include MovieQA, ReCoRD, and RACE, among others.

The Machine Reading group at UCL also provides an overview of reading comprehension tasks.

Figure source: A Survey on Machine Reading Comprehension: Tasks, Evaluation Metrics and Benchmark Datasets

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1501–1550 of 1760 papers

Title	Date	Tasks	Status
EEG Connectivity Analysis Using Denoising Autoencoders for the Detection of Dyslexia	Nov 23, 2023	DenoisingEEG	—Unverified
Effective Character-augmented Word Embedding for Machine Reading Comprehension	Aug 7, 2018	Machine Reading ComprehensionReading Comprehension	—Unverified
Effective Feature Integration for Automated Short Answer Scoring	May 1, 2015	Reading Comprehensiontext similarity	—Unverified
Effectiveness of Linguistic and Learner Features to Listenability Measurement Using a Decision Tree Classifier	Dec 1, 2016	Reading Comprehension	—Unverified
Effect of Syntactic Features in Bangla Sentence Comprehension	Dec 1, 2016	Language AcquisitionReading Comprehension	—Unverified
Efficient LLM Inference with Kcache	Apr 28, 2024	Reading Comprehension	—Unverified
EFLLex: A Graded Lexical Resource for Learners of English as a Foreign Language	May 1, 2018	Language AcquisitionReading Comprehension	—Unverified
ELiRF-UPV at SemEval-2018 Task 11: Machine Comprehension using Commonsense Knowledge	Jun 1, 2018	Multiple-choiceQuestion Answering	—Unverified
Embracing data abundance: BookTest Dataset for Reading Comprehension	Oct 4, 2016	Reading Comprehension	—Unverified
Emergent: a novel data-set for stance classification	Jun 1, 2016	ClassificationGeneral Classification	—Unverified
Emergent Predication Structure in Hidden State Vectors of Neural Readers	Nov 23, 2016	Reading Comprehension	—Unverified
Empirical Evaluation of Post-Training Quantization Methods for Language Tasks	Oct 29, 2022	AttributeQuantization	—Unverified
Empirical Methods for the Study of Denotation in Nominalizations in Spanish	Jan 1, 2012	Machine TranslationNatural Language Inference	—Unverified
emrQA-msquad: A Medical Dataset Structured with the SQuAD V2.0 Framework, Enriched with emrQA Medical Information	Apr 18, 2024	Decision MakingMachine Reading Comprehension	—Unverified
End-to-End Answer Chunk Extraction and Ranking for Reading Comprehension	Oct 31, 2016	Question AnsweringReading Comprehension	—Unverified
End-to-End QA on COVID-19: Domain Adaptation with Synthetic Training	Dec 2, 2020	Domain AdaptationInformation Retrieval	—Unverified
Enhanced Electronic Health Records Text Summarization Using Large Language Models	Oct 12, 2024	Question AnsweringReading Comprehension	—Unverified
Enhancing Answer Boundary Detection for Multilingual Machine Reading Comprehension	Apr 29, 2020	Boundary DetectionMachine Reading Comprehension	—Unverified
Enhancing Key-Value Memory Neural Networks for Knowledge Based Question Answering	Jun 1, 2019	Question AnsweringReading Comprehension	—Unverified
Enhancing Multiple-choice Machine Reading Comprehension by Punishing Illogical Interpretations	Nov 1, 2021	AttributeMachine Reading Comprehension	—Unverified
Enhancing Pre-Trained Generative Language Models with Question Attended Span Extraction on Machine Reading Comprehension	Apr 27, 2024	Machine Reading ComprehensionReading Comprehension	—Unverified
Enhancing Robustness of Retrieval-Augmented Language Models with In-Context Learning	Aug 8, 2024	In-Context LearningMachine Reading Comprehension	—Unverified
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning	May 25, 2025	DenoisingReading Comprehension	—Unverified
Ensemble approach for natural language question answering problem	Aug 26, 2019	Natural Language UnderstandingQuestion Answering	—Unverified
Ensemble Learning-Based Approach for Improving Generalization Capability of Machine Reading Comprehension Systems	Jul 1, 2021	Ensemble LearningMachine Reading Comprehension	—Unverified
Entity-Centric Joint Modeling of Japanese Coreference Resolution and Predicate Argument Structure Analysis	Jul 1, 2018	coreference-resolutionCoreference Resolution	—Unverified
Entity Linking for Tweets	Aug 1, 2013	Entity LinkingEntity Resolution	—Unverified
Entity Linking meets Word Sense Disambiguation: a Unified Approach	Jan 1, 2014	Entity LinkingLEMMA	—Unverified
eRock at Qur’an QA 2022: Contemporary Deep Neural Networks for Qur’an based Reading Comprehension Question Answers	Jun 1, 2022	Data AugmentationQuestion Answering	—Unverified
ESTER: A Machine Reading Comprehension Dataset for Reasoning about Event Semantic Relations	Nov 1, 2021	Machine Reading ComprehensionNatural Language Queries	—Unverified
Evaluating a How-to Tip Machine Comprehension Model with QA Examples collected from a Community QA Site	Nov 1, 2021	Reading Comprehension	—Unverified
Evaluating and Enhancing the Robustness of Neural Network-based Dependency Parsing Models with Adversarial Examples	Jul 1, 2020	Dependency ParsingQuestion Answering	—Unverified
Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting	Jan 28, 2024	Arithmetic ReasoningFact Checking	—Unverified
Evaluating Large Language Model Capability in Vietnamese Fact-Checking Data Generation	Nov 8, 2024	Fact CheckingLanguage Modeling	—Unverified
Evaluating Large Language Models with Tests of Spanish as a Foreign Language: Pass or Fail?	Sep 8, 2024	Natural Language UnderstandingReading Comprehension	—Unverified
Evaluating Machine Reading Systems through Comprehension Tests	May 1, 2012	Answer SelectionMultiple-choice	—Unverified
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users	Mar 28, 2025	Object RecognitionReading Comprehension	—Unverified
Evaluating Neural Machine Comprehension Model Robustness to Noisy Inputs and Adversarial Attacks	May 1, 2020	Reading ComprehensionSentence	—Unverified
Evaluating Neural Model Robustness for Machine Comprehension	Apr 1, 2021	Adversarial Attackmodel	—Unverified
Evaluating NLP Models via Contrast Sets	Oct 1, 2020	Reading ComprehensionSentiment Analysis	—Unverified
Evaluating the Meaning of Answers to Reading Comprehension Questions: A Semantics-Based Approach	Jun 1, 2012	Reading Comprehension	—Unverified
Evaluating the Quality of a Knowledge Base Populated from Text	Jun 1, 2012	Entity LinkingKnowledge Base Population	—Unverified
Evaluating the Rationale Understanding of Critical Reasoning in Logical Reading Comprehension	Nov 30, 2023	Multiple-choiceReading Comprehension	—Unverified
Evaluating the Readability of Text Simplification Output for Readers with Cognitive Disabilities	May 1, 2016	Reading ComprehensionText Simplification	—Unverified
Evaluating the Robustness of Machine Reading Comprehension Models to Low Resource Entity Renaming	Apr 6, 2023	Machine Reading ComprehensionQuestion Answering	—Unverified
Evaluation Dataset and System for Japanese Lexical Simplification	Jul 1, 2015	Lexical SimplificationReading Comprehension	—Unverified
Evaluation for Partial Event Coreference	Jun 1, 2014	Coreference ResolutionNatural Language Inference	—Unverified
Evaluation Metrics for Machine Reading Comprehension: Prerequisite Skills and Readability	Jul 1, 2017	Coreference ResolutionMachine Reading Comprehension	—Unverified
Evaluation of Automatically Generated Pronoun Reference Questions	Sep 1, 2017	Multiple-choiceReading Comprehension	—Unverified
Evaluation of Dataset Selection for Pre-Training and Fine-Tuning Transformer Language Models for Clinical Question Answering	May 1, 2020	Machine Reading ComprehensionQuestion Answering	—Unverified

Show:10 25 50

← PrevPage 31 of 36Next →

All datasets ReClor RACE MuSeRC AdversarialQA CrowdSource QA RadQA

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	Rational Reasoner / IDOL	Test	80.6	—	Unverified
2	AMR-LE-Ensemble	Test	80	—	Unverified
3	MERIt-deberta-v2-xxlarge deberta.v2.xxlarge.path.override_True.norm_1.1.0.w2.A100.cp200.s42	Test	79.3	—	Unverified
4	MERIt(MERIt-deberta-v2-xxlarge )	Test	79.3	—	Unverified
5	Knowledge model	Test	79.2	—	Unverified
6	DeBERTa-v2-xxlarge-AMR-LE-Contraposition	Test	77.2	—	Unverified
7	LReasoner ensemble	Test	76.1	—	Unverified
8	ELECTRA and ALBERT	Test	71	—	Unverified
9	WWZ	Test	69.7	—	Unverified
10	xlnet-large-uncased [extended data]	Test	69.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ALBERT (Ensemble)	Accuracy	91.4	—	Unverified
2	Megatron-BERT (ensemble)	Accuracy	90.9	—	Unverified
3	ALBERTxxlarge+DUMA(ensemble)	Accuracy	89.8	—	Unverified
4	Megatron-BERT	Accuracy	89.5	—	Unverified
5	XLNet	Accuracy (Middle)	88.6	—	Unverified
6	DeBERTalarge	Accuracy	86.8	—	Unverified
7	B10-10-10	Accuracy	85.7	—	Unverified
8	RoBERTa	Accuracy	83.2	—	Unverified
9	Orca 2-13B	Accuracy	82.87	—	Unverified
10	Orca 2-7B	Accuracy	80.79	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Golden Transformer	Average F1	0.94	—	Unverified
2	MT5 Large	Average F1	0.84	—	Unverified
3	ruRoberta-large finetune	Average F1	0.83	—	Unverified
4	ruT5-large-finetune	Average F1	0.82	—	Unverified
5	Human Benchmark	Average F1	0.81	—	Unverified
6	ruT5-base-finetune	Average F1	0.77	—	Unverified
7	ruBert-large finetune	Average F1	0.76	—	Unverified
8	ruBert-base finetune	Average F1	0.74	—	Unverified
9	RuGPT3XL few-shot	Average F1	0.74	—	Unverified
10	RuGPT3Large	Average F1	0.73	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	RoBERTa-Large	Overall: F1	64.4	—	Unverified
2	BERT-Large	Overall: F1	62.7	—	Unverified
3	BiDAF	Overall: F1	28.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	BERT	MSE	0.05	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	BERT pretrained on MIMIC-III	Answer F1	63.55	—	Unverified