SOTAVerified

Mathematical Reasoning

Papers

Showing 376–400 of 805 papers

TitleStatusHype
Let's Reinforce Step by Step—0
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability—0
Agent-as-a-Service based on Agent Network—0
LemmaHead: RAG Assisted Proof Generation Using Large Language Models—0
Dynamic Sampling that Adapts: Iterative DPO for Self-Aware Mathematical Reasoning—0
Apriori Knowledge in an Era of Computational Opacity: The Role of AI in Mathematical Discovery—0
Efficient Model-agnostic Alignment via Bayesian Persuasion—0
Learning to Reason With Relational Abstractions—0
Learning to Rank Chain-of-Thought: An Energy-Based Approach with Outcome Supervision—0
MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs—0
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models—0
BitNet b1.58 2B4T Technical Report—0
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation—0
LLM for Complex Reasoning Task: An Exploratory Study in Fermi Problems—0
LLM Library Learning Fails: A LEGO-Prover Case Study—0
Learning to chain-of-thought with Jensen's evidence lower bound—0
LLM Reasoning Engine: Specialized Training for Enhanced Mathematical Reasoning—0
Dual Instruction Tuning with Large Language Models for Mathematical Reasoning—0
LLMs can be easily Confused by Instructional Distractions—0
Applying RLAIF for Code Generation with API-usage in Lightweight LLMs—0
Learning Like Humans: Advancing LLM Reasoning Capabilities via Adaptive Difficulty Curriculum Learning and Expert-Guided Self-Reformulation—0
Learning by Applying: A General Framework for Mathematical Reasoning via Enhancing Explicit Knowledge Learning—0
DavIR: Data Selection via Implicit Reward for Large Language Models—0
DRP: Distilled Reasoning Pruning with Skill-aware Step Decomposition for Efficient Large Reasoning Models—0
Mathematical Reasoning in Latent Space—0
Show:102550
← PrevPage 16 of 33Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1XolverAcc94.4—Unverified
2DeepSeek-r1Acc79.8—Unverified
3Openai-o1Acc74.4—Unverified
4Openai-o1-miniAcc70—Unverified
5Search-o1Acc56.7—Unverified
6s1-32BAcc56.7—Unverified
7Openai-o1-previewAcc44.6—Unverified
8Qwen2.5-72B-InstructAcc23.3—Unverified
9Claude3.5-SonnetAcc16—Unverified
#ModelMetricClaimedVerifiedStatus
1o3Accuracy0.25—Unverified
2Gemini 1.5 Pro (002)Accuracy0.02—Unverified
3GPT-4oAccuracy0.01—Unverified
4o1-miniAccuracy0.01—Unverified
5o1-previewAccuracy0.01—Unverified
6Claude 3.5 SonnetAccuracy0.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.6—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.48—Unverified
3Neo-P (Fine-tuned, 2.7B)Accuracy0.39—Unverified
4GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
5Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.25—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.59—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.45—Unverified
3GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
4Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.27—Unverified
5Neo-P (Fine-tuned, 2.7B)Accuracy0.24—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.18—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDCompletion accuracy65.8—Unverified
2PGPSNetCompletion accuracy62.7—Unverified
3GAPSCompletion accuracy61.2—Unverified
4Inter-GPSCompletion accuracy59.8—Unverified
5GeoformerCompletion accuracy35.6—Unverified
6NGSCompletion accuracy34.1—Unverified
#ModelMetricClaimedVerifiedStatus
1QWQ-32B-previewAcc82.5—Unverified
2Math-MasterAcc82—Unverified
3Qwen2.5-Math-7B-instructAcc62.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)75.2—Unverified
2GAPSAccuracy (%)67.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Search-o1Acc86.4—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)98.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GAPSAccuracy (%)97.5—Unverified