Reading Comprehension

Most current question answering datasets frame the task as reading comprehension where the question is about a paragraph or document and the answer often is a span in the document.

Some specific tasks of reading comprehension include multi-modal machine reading comprehension and textual machine reading comprehension, among others. In the literature, machine reading comprehension can be divide into four categories: cloze style, multiple choice, span prediction, and free-form answer. Read more about each category here.

Benchmark datasets used for testing a model's reading comprehension abilities include MovieQA, ReCoRD, and RACE, among others.

The Machine Reading group at UCL also provides an overview of reading comprehension tasks.

Figure source: A Survey on Machine Reading Comprehension: Tasks, Evaluation Metrics and Benchmark Datasets

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1501–1525 of 1760 papers

Title	Date	Tasks	Status
EEG Connectivity Analysis Using Denoising Autoencoders for the Detection of Dyslexia	Nov 23, 2023	DenoisingEEG	—Unverified
Effective Character-augmented Word Embedding for Machine Reading Comprehension	Aug 7, 2018	Machine Reading ComprehensionReading Comprehension	—Unverified
Effective Feature Integration for Automated Short Answer Scoring	May 1, 2015	Reading Comprehensiontext similarity	—Unverified
Effectiveness of Linguistic and Learner Features to Listenability Measurement Using a Decision Tree Classifier	Dec 1, 2016	Reading Comprehension	—Unverified
Effect of Syntactic Features in Bangla Sentence Comprehension	Dec 1, 2016	Language AcquisitionReading Comprehension	—Unverified
Efficient LLM Inference with Kcache	Apr 28, 2024	Reading Comprehension	—Unverified
EFLLex: A Graded Lexical Resource for Learners of English as a Foreign Language	May 1, 2018	Language AcquisitionReading Comprehension	—Unverified
ELiRF-UPV at SemEval-2018 Task 11: Machine Comprehension using Commonsense Knowledge	Jun 1, 2018	Multiple-choiceQuestion Answering	—Unverified
Embracing data abundance: BookTest Dataset for Reading Comprehension	Oct 4, 2016	Reading Comprehension	—Unverified
Emergent: a novel data-set for stance classification	Jun 1, 2016	ClassificationGeneral Classification	—Unverified
Emergent Predication Structure in Hidden State Vectors of Neural Readers	Nov 23, 2016	Reading Comprehension	—Unverified
Empirical Evaluation of Post-Training Quantization Methods for Language Tasks	Oct 29, 2022	AttributeQuantization	—Unverified
Empirical Methods for the Study of Denotation in Nominalizations in Spanish	Jan 1, 2012	Machine TranslationNatural Language Inference	—Unverified
emrQA-msquad: A Medical Dataset Structured with the SQuAD V2.0 Framework, Enriched with emrQA Medical Information	Apr 18, 2024	Decision MakingMachine Reading Comprehension	—Unverified
End-to-End Answer Chunk Extraction and Ranking for Reading Comprehension	Oct 31, 2016	Question AnsweringReading Comprehension	—Unverified
End-to-End QA on COVID-19: Domain Adaptation with Synthetic Training	Dec 2, 2020	Domain AdaptationInformation Retrieval	—Unverified
Enhanced Electronic Health Records Text Summarization Using Large Language Models	Oct 12, 2024	Question AnsweringReading Comprehension	—Unverified
Enhancing Answer Boundary Detection for Multilingual Machine Reading Comprehension	Apr 29, 2020	Boundary DetectionMachine Reading Comprehension	—Unverified
Enhancing Key-Value Memory Neural Networks for Knowledge Based Question Answering	Jun 1, 2019	Question AnsweringReading Comprehension	—Unverified
Enhancing Multiple-choice Machine Reading Comprehension by Punishing Illogical Interpretations	Nov 1, 2021	AttributeMachine Reading Comprehension	—Unverified
Enhancing Pre-Trained Generative Language Models with Question Attended Span Extraction on Machine Reading Comprehension	Apr 27, 2024	Machine Reading ComprehensionReading Comprehension	—Unverified
Enhancing Robustness of Retrieval-Augmented Language Models with In-Context Learning	Aug 8, 2024	In-Context LearningMachine Reading Comprehension	—Unverified
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning	May 25, 2025	DenoisingReading Comprehension	—Unverified
Ensemble approach for natural language question answering problem	Aug 26, 2019	Natural Language UnderstandingQuestion Answering	—Unverified
Ensemble Learning-Based Approach for Improving Generalization Capability of Machine Reading Comprehension Systems	Jul 1, 2021	Ensemble LearningMachine Reading Comprehension	—Unverified

Show:10 25 50

← PrevPage 61 of 71Next →

All datasets ReClor RACE MuSeRC AdversarialQA CrowdSource QA RadQA

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	Rational Reasoner / IDOL	Test	80.6	—	Unverified
2	AMR-LE-Ensemble	Test	80	—	Unverified
3	MERIt(MERIt-deberta-v2-xxlarge )	Test	79.3	—	Unverified
4	MERIt-deberta-v2-xxlarge deberta.v2.xxlarge.path.override_True.norm_1.1.0.w2.A100.cp200.s42	Test	79.3	—	Unverified
5	Knowledge model	Test	79.2	—	Unverified
6	DeBERTa-v2-xxlarge-AMR-LE-Contraposition	Test	77.2	—	Unverified
7	LReasoner ensemble	Test	76.1	—	Unverified
8	ELECTRA and ALBERT	Test	71	—	Unverified
9	WWZ	Test	69.7	—	Unverified
10	xlnet-large-uncased [extended data]	Test	69.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ALBERT (Ensemble)	Accuracy	91.4	—	Unverified
2	Megatron-BERT (ensemble)	Accuracy	90.9	—	Unverified
3	ALBERTxxlarge+DUMA(ensemble)	Accuracy	89.8	—	Unverified
4	Megatron-BERT	Accuracy	89.5	—	Unverified
5	XLNet	Accuracy (Middle)	88.6	—	Unverified
6	DeBERTalarge	Accuracy	86.8	—	Unverified
7	B10-10-10	Accuracy	85.7	—	Unverified
8	RoBERTa	Accuracy	83.2	—	Unverified
9	Orca 2-13B	Accuracy	82.87	—	Unverified
10	Orca 2-7B	Accuracy	80.79	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Golden Transformer	Average F1	0.94	—	Unverified
2	MT5 Large	Average F1	0.84	—	Unverified
3	ruRoberta-large finetune	Average F1	0.83	—	Unverified
4	ruT5-large-finetune	Average F1	0.82	—	Unverified
5	Human Benchmark	Average F1	0.81	—	Unverified
6	ruT5-base-finetune	Average F1	0.77	—	Unverified
7	ruBert-large finetune	Average F1	0.76	—	Unverified
8	ruBert-base finetune	Average F1	0.74	—	Unverified
9	RuGPT3XL few-shot	Average F1	0.74	—	Unverified
10	RuGPT3Large	Average F1	0.73	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	RoBERTa-Large	Overall: F1	64.4	—	Unverified
2	BERT-Large	Overall: F1	62.7	—	Unverified
3	BiDAF	Overall: F1	28.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	BERT	MSE	0.05	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	BERT pretrained on MIMIC-III	Answer F1	63.55	—	Unverified