SOTAVerified

Mathematical Reasoning

Papers

Showing 551–600 of 805 papers

TitleStatusHype
Buffer of Thoughts: Thought-Augmented Reasoning with Large Language Models—0
Improve Mathematical Reasoning in Language Models by Automated Process Supervision—0
Assessing the Emergent Symbolic Reasoning Abilities of Llama Large Language Models—0
Pre-trained Large Language Models Use Fourier Features to Compute Addition—0
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language ModelsCode0
IrokoBench: A New Benchmark for African Languages in the Age of Large Language Models—0
Process-Driven Autoformalization in Lean 4Code1
Exploring Mathematical Extrapolation of Large Language Models with Synthetic Data—0
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and CorrectionCode0
Efficient Model-agnostic Alignment via Bayesian Persuasion—0
MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn InteractionsCode1
ReflectionCoder: Learning from Reflection Sequence for Enhanced One-off Code GenerationCode1
STRIDE: A Tool-Assisted LLM Agent Framework for Strategic and Interactive Decision-MakingCode1
Basis Selection: Low-Rank Decomposition of Pretrained Large Language Models for Target Applications—0
VB-LoRA: Extreme Parameter Efficient Fine-Tuning with Vector BanksCode1
Intelligent Go-Explore: Standing on the Shoulders of Giant Foundation ModelsCode2
Can LLMs Solve longer Math Word Problems Better?Code0
DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data—0
JiuZhang3.0: Efficiently Improving Mathematical Reasoning by Training Small Data Synthesis ModelsCode1
Embedding Trajectory for Out-of-Distribution Detection in Mathematical ReasoningCode1
DOP: Diagnostic-Oriented Prompting for Large Language Models in Mathematical CorrectionCode0
MoRA: High-Rank Updating for Parameter-Efficient Fine-TuningCode3
A Systematic Evaluation of Large Language Models for Natural Language Generation Tasks—0
MuMath-Code: Combining Tool-Use Large Language Models with Multi-perspective Data Augmentation for Mathematical ReasoningCode3
MathDivide: Improved mathematical reasoning by large language models—0
Aligning Tutor Discourse Supporting Rigorous Thinking with Tutee Content Mastery for Predicting Math Achievement—0
LLMs can Find Mathematical Reasoning Mistakes by Pedagogical Chain-of-Thought—0
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual ContextCode1
AlphaMath Almost Zero: Process Supervision without ProcessCode3
Exploring the Compositional Deficiency of Large Language Models in Mathematical ReasoningCode2
GOLD: Geometry Problem Solver with Natural Language DescriptionCode1
A Careful Examination of Large Language Model Performance on Grade School Arithmetic—0
Exploring the Limits of Fine-grained LLM-based Physics Inference via Premise Removal Interventions—0
Benchmarking Benchmark Leakage in Large Language ModelsCode2
Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training—0
PARAMANU-GANITA: Language Model with Mathematical Capabilities—0
Pre-Calc: Learning to Use the Calculator Improves Numeracy in Language ModelsCode0
iTBLS: A Dataset of Interactive Conversations Over Tabular Information—0
Toward Self-Improvement of LLMs via Imagination, Searching, and CriticizingCode1
Enhancing Length Extrapolation in Sequential Models with Pointer-Augmented Neural Memory—0
Paraphrase and Solve: Exploring and Exploiting the Impact of Surface Form on Mathematical Reasoning in Large Language ModelsCode0
Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained RewardsCode2
Compression Represents Intelligence LinearlyCode2
Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy CompetitionCode0
Evaluating Mathematical Reasoning Beyond AccuracyCode2
SAAS: Solving Ability Amplification Strategy for Enhanced Mathematical Reasoning in Large Language Models—0
Exploring the Mystery of Influential Data for Mathematical Reasoning—0
Can LLMs Master Math? Investigating Large Language Models on Math Stack ExchangeCode0
Planning and Editing What You Retrieve for Enhanced Tool LearningCode0
Dual Instruction Tuning with Large Language Models for Mathematical Reasoning—0
Show:102550
← PrevPage 12 of 17Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1XolverAcc94.4—Unverified
2DeepSeek-r1Acc79.8—Unverified
3Openai-o1Acc74.4—Unverified
4Openai-o1-miniAcc70—Unverified
5Search-o1Acc56.7—Unverified
6s1-32BAcc56.7—Unverified
7Openai-o1-previewAcc44.6—Unverified
8Qwen2.5-72B-InstructAcc23.3—Unverified
9Claude3.5-SonnetAcc16—Unverified
#ModelMetricClaimedVerifiedStatus
1o3Accuracy0.25—Unverified
2Gemini 1.5 Pro (002)Accuracy0.02—Unverified
3GPT-4oAccuracy0.01—Unverified
4o1-miniAccuracy0.01—Unverified
5o1-previewAccuracy0.01—Unverified
6Claude 3.5 SonnetAccuracy0.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.6—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.48—Unverified
3Neo-P (Fine-tuned, 2.7B)Accuracy0.39—Unverified
4GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
5Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.25—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.59—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.45—Unverified
3GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
4Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.27—Unverified
5Neo-P (Fine-tuned, 2.7B)Accuracy0.24—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.18—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDCompletion accuracy65.8—Unverified
2PGPSNetCompletion accuracy62.7—Unverified
3GAPSCompletion accuracy61.2—Unverified
4Inter-GPSCompletion accuracy59.8—Unverified
5GeoformerCompletion accuracy35.6—Unverified
6NGSCompletion accuracy34.1—Unverified
#ModelMetricClaimedVerifiedStatus
1QWQ-32B-previewAcc82.5—Unverified
2Math-MasterAcc82—Unverified
3Qwen2.5-Math-7B-instructAcc62.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)75.2—Unverified
2GAPSAccuracy (%)67.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Search-o1Acc86.4—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)98.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GAPSAccuracy (%)97.5—Unverified