SOTAVerified

Mathematical Reasoning

Papers

Showing 1–10 of 805 papers

TitleStatusHype
VAR-MATH: Probing True Mathematical Reasoning in Large Language Models via Symbolic Multi-Instance Benchmarks—0
A Survey of Deep Learning for Geometry Problem SolvingCode0
KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?—0
Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data ContaminationCode1
A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement LearningCode1
Integrating External Tools with Large Language Models to Improve Accuracy—0
Agentic-R1: Distilled Dual-Strategy ReasoningCode0
CriticLean: Critic-Guided Reinforcement Learning for Mathematical FormalizationCode1
CoRE: Enhancing Metacognition with Label-free Self-evaluation in LRMs—0
Skywork-R1V3 Technical ReportCode7
Show:102550
← PrevPage 1 of 81Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1XolverAcc94.4—Unverified
2DeepSeek-r1Acc79.8—Unverified
3Openai-o1Acc74.4—Unverified
4Openai-o1-miniAcc70—Unverified
5Search-o1Acc56.7—Unverified
6s1-32BAcc56.7—Unverified
7Openai-o1-previewAcc44.6—Unverified
8Qwen2.5-72B-InstructAcc23.3—Unverified
9Claude3.5-SonnetAcc16—Unverified