SOTAVerified

Mathematical Reasoning

Papers

Showing 351–400 of 805 papers

TitleStatusHype
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision—0
LLMs can implicitly learn from mistakes in-context—0
LLMs can Find Mathematical Reasoning Mistakes by Pedagogical Chain-of-Thought—0
LLMs-as-Instructors: Learning from Errors Toward Automating Model Improvement—0
Enhancing Length Extrapolation in Sequential Models with Pointer-Augmented Neural Memory—0
Brains vs. Bytes: Evaluating LLM Proficiency in Olympiad Mathematics—0
math-PVS: A Large Language Model Framework to Map Scientific Publications to PVS Theories—0
Embedding Self-Correction as an Inherent Ability in Large Language Models for Enhanced Mathematical Reasoning—0
Eliciting Reasoning in Language Models with Cognitive Tools—0
Bottlenecked Transformers: Periodic KV Cache Abstraction for Generalised Reasoning—0
LLaMa-SciQ: An Educational Chatbot for Answering Science MCQ—0
LiteSearch: Efficacious Tree Search for LLM—0
Efficient Tool Use with Chain-of-Abstraction Reasoning—0
Accurate and Diverse LLM Mathematical Reasoning via Automated PRM-Guided GFlowNets—0
MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?—0
MergeME: Model Merging Techniques for Homogeneous and Heterogeneous MoEs—0
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation—0
MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model—0
Efficient Long CoT Reasoning in Small Language Models—0
LexPam: Legal Procedure Awareness-Guided Mathematical Reasoning—0
Leveraging Constrained Monte Carlo Tree Search to Generate Reliable Long Chain-of-Thought for Mathematical Reasoning—0
MATHGLANCE: Multimodal Large Language Models Do Not Know Where to Look in Mathematical Diagrams—0
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs—0
Let's reward step by step: Step-Level reward model as the Navigators for Reasoning—0
Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning—0
Let's Reinforce Step by Step—0
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability—0
Agent-as-a-Service based on Agent Network—0
LemmaHead: RAG Assisted Proof Generation Using Large Language Models—0
Dynamic Sampling that Adapts: Iterative DPO for Self-Aware Mathematical Reasoning—0
Apriori Knowledge in an Era of Computational Opacity: The Role of AI in Mathematical Discovery—0
Efficient Model-agnostic Alignment via Bayesian Persuasion—0
Learning to Reason With Relational Abstractions—0
Learning to Rank Chain-of-Thought: An Energy-Based Approach with Outcome Supervision—0
MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs—0
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models—0
BitNet b1.58 2B4T Technical Report—0
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation—0
LLM for Complex Reasoning Task: An Exploratory Study in Fermi Problems—0
LLM Library Learning Fails: A LEGO-Prover Case Study—0
Learning to chain-of-thought with Jensen's evidence lower bound—0
LLM Reasoning Engine: Specialized Training for Enhanced Mathematical Reasoning—0
Dual Instruction Tuning with Large Language Models for Mathematical Reasoning—0
LLMs can be easily Confused by Instructional Distractions—0
Applying RLAIF for Code Generation with API-usage in Lightweight LLMs—0
Learning Like Humans: Advancing LLM Reasoning Capabilities via Adaptive Difficulty Curriculum Learning and Expert-Guided Self-Reformulation—0
Learning by Applying: A General Framework for Mathematical Reasoning via Enhancing Explicit Knowledge Learning—0
DavIR: Data Selection via Implicit Reward for Large Language Models—0
DRP: Distilled Reasoning Pruning with Skill-aware Step Decomposition for Efficient Large Reasoning Models—0
Mathematical Reasoning in Latent Space—0
Show:102550
← PrevPage 8 of 17Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1XolverAcc94.4—Unverified
2DeepSeek-r1Acc79.8—Unverified
3Openai-o1Acc74.4—Unverified
4Openai-o1-miniAcc70—Unverified
5Search-o1Acc56.7—Unverified
6s1-32BAcc56.7—Unverified
7Openai-o1-previewAcc44.6—Unverified
8Qwen2.5-72B-InstructAcc23.3—Unverified
9Claude3.5-SonnetAcc16—Unverified
#ModelMetricClaimedVerifiedStatus
1o3Accuracy0.25—Unverified
2Gemini 1.5 Pro (002)Accuracy0.02—Unverified
3GPT-4oAccuracy0.01—Unverified
4o1-miniAccuracy0.01—Unverified
5o1-previewAccuracy0.01—Unverified
6Claude 3.5 SonnetAccuracy0.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.6—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.48—Unverified
3Neo-P (Fine-tuned, 2.7B)Accuracy0.39—Unverified
4GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
5Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.25—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.59—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.45—Unverified
3GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
4Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.27—Unverified
5Neo-P (Fine-tuned, 2.7B)Accuracy0.24—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.18—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDCompletion accuracy65.8—Unverified
2PGPSNetCompletion accuracy62.7—Unverified
3GAPSCompletion accuracy61.2—Unverified
4Inter-GPSCompletion accuracy59.8—Unverified
5GeoformerCompletion accuracy35.6—Unverified
6NGSCompletion accuracy34.1—Unverified
#ModelMetricClaimedVerifiedStatus
1QWQ-32B-previewAcc82.5—Unverified
2Math-MasterAcc82—Unverified
3Qwen2.5-Math-7B-instructAcc62.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)75.2—Unverified
2GAPSAccuracy (%)67.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Search-o1Acc86.4—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)98.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GAPSAccuracy (%)97.5—Unverified