SOTAVerified

Mathematical Reasoning

Papers

Showing 451–500 of 805 papers

TitleStatusHype
Improving Multilingual Math Reasoning for African Languages—0
Improving Physics Reasoning in Large Language Models Using Mixture of Refinement Agents—0
Improving RL Exploration for LLM Reasoning through Retrospective Replay—0
Improving Rule-based Reasoning in LLMs via Neurosymbolic Representations—0
Distilling Mathematical Reasoning Capabilities into Small Language Models—0
Improving Small-Scale Large Language Models Function Calling for Reasoning Tasks—0
InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning—0
Innate Reasoning is Not Enough: In-Context Learning Enhances Reasoning Large Language Models with Less Overthinking—0
Inside you are many wolves: Using cognitive models to interpret value trade-offs in LLMs—0
Integrating Arithmetic Learning Improves Mathematical Reasoning in Smaller Models—0
Integrating External Tools with Large Language Models to Improve Accuracy—0
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model—0
Investigating the Effectiveness of ChatGPT in Mathematical Reasoning and Problem Solving: Evidence from the Vietnamese National High School Graduation Examination—0
Investigating the interaction of linguistic and mathematical reasoning in language models using multilingual number puzzles—0
Investigating the Potential of Large Language Model-Based Router Multi-Agent Architectures for Foundation Design Automation: A Task Classification and Expert Selection Study—0
IrokoBench: A New Benchmark for African Languages in the Age of Large Language Models—0
Is Your Model Really A Good Math Reasoner? Evaluating Mathematical Reasoning with Checklist—0
iTBLS: A Dataset of Interactive Conversations Over Tabular Information—0
JiuZhang 2.0: A Unified Chinese Pre-trained Language Model for Multi-task Mathematical Problem Solving—0
Keep Guessing? When Considering Inference Scaling, Mind the Baselines—0
Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning—0
Key-Point-Driven Mathematical Reasoning Distillation of Large Language Model—0
KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?—0
Knowledge Augmented Complex Problem Solving with Large Language Models: A Survey—0
Knowledge Distillation of LLM for Automatic Scoring of Science Education Assessments—0
Kwai-STaR: Transform LLMs into State-Transition Reasoners—0
KwaiYiiMath: Technical Report—0
Mathematical Reasoning via Self-supervised Skip-tree Training—0
Language Models Use Trigonometry to Do Addition—0
LANS: A Layout-Aware Neural Solver for Plane Geometry Problem—0
Large Language Models and Mathematical Reasoning Failures—0
Large Language Models Don't Make Sense of Word Problems. A Scoping Review from a Mathematics Education Perspective—0
Large Language Models for Combinatorial Optimization of Design Structure Matrix—0
Large Language Models for Design Structure Matrix Optimization—0
Large Language Models for Mathematical Reasoning: Progresses and Challenges—0
Large Language Models Have Intrinsic Meta-Cognition, but Need a Good Lens—0
Large Multi-Modal Models (LMMs) as Universal Foundation Models for AI-Native Wireless Systems—0
Layer Importance for Mathematical Reasoning is Forged in Pre-Training and Invariant after Post-Training—0
Layer Swapping for Zero-Shot Cross-Lingual Transfer in Large Language Models—0
LeanProgress: Guiding Search for Neural Theorem Proving via Proof Progress Prediction—0
LearnAlign: Reasoning Data Selection for Reinforcement Learning in Large Language Models Based on Improved Gradient Alignment—0
Learning by Applying: A General Framework for Mathematical Reasoning via Enhancing Explicit Knowledge Learning—0
Learning Like Humans: Advancing LLM Reasoning Capabilities via Adaptive Difficulty Curriculum Learning and Expert-Guided Self-Reformulation—0
Learning to chain-of-thought with Jensen's evidence lower bound—0
Learning to Rank Chain-of-Thought: An Energy-Based Approach with Outcome Supervision—0
Learning to Reason With Relational Abstractions—0
LemmaHead: RAG Assisted Proof Generation Using Large Language Models—0
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability—0
Let's Reinforce Step by Step—0
Let's reward step by step: Step-Level reward model as the Navigators for Reasoning—0
Show:102550
← PrevPage 10 of 17Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1XolverAcc94.4—Unverified
2DeepSeek-r1Acc79.8—Unverified
3Openai-o1Acc74.4—Unverified
4Openai-o1-miniAcc70—Unverified
5Search-o1Acc56.7—Unverified
6s1-32BAcc56.7—Unverified
7Openai-o1-previewAcc44.6—Unverified
8Qwen2.5-72B-InstructAcc23.3—Unverified
9Claude3.5-SonnetAcc16—Unverified
#ModelMetricClaimedVerifiedStatus
1o3Accuracy0.25—Unverified
2Gemini 1.5 Pro (002)Accuracy0.02—Unverified
3GPT-4oAccuracy0.01—Unverified
4o1-miniAccuracy0.01—Unverified
5o1-previewAccuracy0.01—Unverified
6Claude 3.5 SonnetAccuracy0.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.6—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.48—Unverified
3Neo-P (Fine-tuned, 2.7B)Accuracy0.39—Unverified
4GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
5Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.25—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.59—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.45—Unverified
3GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
4Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.27—Unverified
5Neo-P (Fine-tuned, 2.7B)Accuracy0.24—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.18—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDCompletion accuracy65.8—Unverified
2PGPSNetCompletion accuracy62.7—Unverified
3GAPSCompletion accuracy61.2—Unverified
4Inter-GPSCompletion accuracy59.8—Unverified
5GeoformerCompletion accuracy35.6—Unverified
6NGSCompletion accuracy34.1—Unverified
#ModelMetricClaimedVerifiedStatus
1QWQ-32B-previewAcc82.5—Unverified
2Math-MasterAcc82—Unverified
3Qwen2.5-Math-7B-instructAcc62.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)75.2—Unverified
2GAPSAccuracy (%)67.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Search-o1Acc86.4—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)98.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GAPSAccuracy (%)97.5—Unverified