SOTAVerified

Automated Essay Scoring

Essay scoring: Automated Essay Scoring is the task of assigning a score to an essay, usually in the context of assessing the language ability of a language learner. The quality of an essay is affected by the following four primary dimensions: topic relevance, organization and coherence, word usage and sentence complexity, and grammar and mechanics.

Source: A Joint Model for Multimodal Document Quality Assessment

Papers

Showing 1–50 of 104 papers

TitleStatusHype
Enhancing Marker Scoring Accuracy through Ordinal Confidence Modelling in Educational Assessments—0
Automated Essay Scoring Incorporating Annotations from Automated Feedback Systems—0
Composable Cross-prompt Essay Scoring by Merging Models—0
CAFES: A Collaborative Multi-Agent Framework for Multi-Granular Multimodal Essay Scoring—0
TRATES: Trait-Specific Rubric-Assisted Cross-Prompt Essay Scoring—0
LCES: Zero-shot Automated Essay Scoring via Pairwise Comparisons Using Large Language Models—0
Do We Need a Detailed Rubric for Automated Essay Scoring using Large Language Models?—0
Does the Prompt-based Large Language Model Recognize Students' Demographics and Introduce Bias in Essay Scoring?—0
Evolution of AI in Education: Agentic Workflows—0
ARWI: Arabic Write and Improve—0
Enhancing Arabic Automated Essay Scoring with Synthetic Data and Error Injection—0
EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models—0
How well can LLMs Grade Essays in Arabic?—0
On the Suitability of pre-trained foundational LLMs for Analysis in German Legal Education—0
The Impact of Example Selection in Few-Shot Prompting on Automated Essay Scoring Using GPT Models—0
Rationale Behind Essay Scores: Enhancing S-LLM's Multi-Trait Essay Scoring with Rationale Generated by LLMs—0
Autoregressive Multi-trait Essay Scoring via Reinforcement Learning with Scoring-aware Multiple Rewards—0
Are Large Language Models Good Essay Graders?—0
Automated essay scoring in Arabic: a dataset and analysis of a BERT-based system—0
Is GPT-4 Alone Sufficient for Automated Essay Scoring?: A Comparative Judgment Approach Based on Rater Cognition—0
Automated Essay Scoring Using Grammatical Variety and Errors with Multi-Task Learning and Item Response Theory—0
Automatic Essay Multi-dimensional Scoring with Fine-tuning and Multiple Regression—0
Beyond Agreement: Diagnosing the Rationale Alignment of Automated Essay Scoring Methods based on Linguistically-informed CounterfactualsCode0
Graded Relevance Scoring of Written Essays with Dense Retrieval—0
Can GPT-4 do L2 analytic assessment?—0
Exploring LLM Prompting Strategies for Joint Essay Scoring and Feedback GenerationCode0
Unleashing Large Language Models' Proficiency in Zero-shot Essay Scoring—0
Transformer-based Joint Modelling for Automatic Essay Scoring and Off-Topic Detection—0
Autoregressive Score Generation for Multi-trait Essay ScoringCode0
Can Large Language Models Automatically Score Proficiency of Written Essays?Code0
Frustratingly Simple Prompting-based Text Denoising—0
DREsS: Dataset for Rubric-based Essay Scoring on EFL Writing—0
VerAs: Verify then Assess STEM Lab ReportsCode0
Human-AI Collaborative Essay Scoring: A Dual-Process Framework with LLMsCode1
Unveiling the Tapestry of Automated Essay Scoring: A Comprehensive Investigation of Accuracy, Fairness, and GeneralizabilityCode0
Empirical Study of Large Language Models as Automated Essay Scoring Tools in English Composition__Taking TOEFL Independent Writing Task for Example—0
Enhancing Essay Scoring with Adversarial Weights Perturbation and Metric-specific AttentionPooling—0
Learning to love diligent trolls: Accounting for rater effects in the dialogue safety taskCode0
LLM-as-a-tutor in EFL Writing Education: Focusing on Evaluation of Student-LLM Interaction—0
Rubric-Specific Approach to Automated Essay Scoring with Augmentation Training—0
Review of feedback in Automated Essay Scoring—0
Automated Essay Scoring in Argumentative Writing: DeBERTeachingAssistant—0
Modeling Structural Similarities between Documents for Coherence Assessment with Graph Convolutional NetworksCode0
Prompt- and Trait Relation-aware Cross-prompt Essay Trait ScoringCode1
The Effectiveness of a Dynamic Loss Function in Neural Network Based Automated Essay Scoring—0
WikiSQE: A Large-Scale Dataset for Sentence Quality Estimation in WikipediaCode0
Can ChatGPT and Bard Generate Aligned Assessment Items? A Reliability Analysis against Human Performance—0
H-AES: Towards Automated Essay Scoring for HindiCode0
Using Active Learning Methods to Strategically Select Essays for Automated Scoring—0
Data Augmentation for Automated Essay Scoring using Transformer Models—0
Show:102550
← PrevPage 1 of 3Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1Neural Pairwise Contrastive Regression (NPCR)Quadratic Weighted Kappa0.82—Unverified
2Tran-BERT-MS-ML-RQuadratic Weighted Kappa0.79—Unverified
3Considering-Content-XLNetQuadratic Weighted Kappa0.79—Unverified
4HISK+BOSWEQuadratic Weighted Kappa0.79—Unverified
5SkipFlowQuadratic Weighted Kappa0.76—Unverified
6MHMLWQuadratic Weighted Kappa0.76—Unverified
7AFQuadratic Weighted Kappa0.73—Unverified
8FDAQuadratic Weighted Kappa0.71—Unverified