SOTAVerified

Mathematical Reasoning

Papers

Showing 601–650 of 805 papers

TitleStatusHype
MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?—0
Reinforcement Learning from Reflective Feedback (RLRF): Aligning and Improving LLMs via Fine-Grained Self-Reflection—0
Instructing Large Language Models to Identify and Ignore Irrelevant ConditionsCode0
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety—0
Apriori Knowledge in an Era of Computational Opacity: The Role of AI in Mathematical Discovery—0
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models—0
Prompt Selection and Augmentation for Few Examples Code Generation in Large Language Model and its Application in Robotics Control—0
RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in Long-Horizon GenerationCode3
Machine learning and information theory concepts towards an AI Mathematician—0
MathScale: Scaling Instruction Tuning for Mathematical ReasoningCode0
Masked Thought: Simply Masking Partial Reasoning Steps Can Improve Mathematical Reasoning Learning of Language ModelsCode1
Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning—0
You Need to Pay Better Attention: Rethinking the Mathematics of Attention Mechanism—0
Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models—0
GSM-Plus: A Comprehensive Benchmark for Evaluating the Robustness of LLMs as Mathematical Problem SolversCode2
Reasoning in Conversation: Solving Subjective Tasks through Dialogue Simulation for Large Language Models—0
MATHSENSEI: A Tool-Augmented Large Language Model for Mathematical ReasoningCode0
MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs—0
Stepwise Self-Consistent Mathematical Reasoning with Large Language ModelsCode1
How Do Humans Write Code? Large Models Do It the Same Way TooCode0
Look Before You Leap: Problem Elaboration Prompting Improves Mathematical Reasoning in Large Language Models—0
Brain-Inspired Two-Stage Approach: Enhancing Mathematical Reasoning by Imitating Human Thought ProcessesCode0
Measuring Multimodal Mathematical Reasoning with MATH-Vision DatasetCode2
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language ModelsCode1
Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models—0
Learning to Check: Unleashing Potentials for Self-Correction in Large Language ModelsCode1
Reformatted AlignmentCode2
Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as AgentsCode1
Pride and Prejudice: LLM Amplifies Self-Bias in Self-RefinementCode0
Evaluating LLMs' Mathematical Reasoning in Financial Document Question Answering—0
When is Tree Search Useful for LLM Planning? It Depends on the DiscriminatorCode2
Reasoning over Uncertain Text by Generative Large Language ModelsCode0
MUSTARD: Mastering Uniform Synthesis of Theorem and Proof DataCode1
Fourier Circuits in Neural Networks and Transformers: A Case Study of Modular Arithmetic with Multiple Inputs—0
Autonomous Data Selection with Zero-shot Generative Classifiers for Mathematical TextsCode2
Can Graph Descriptive Order Affect Solving Graph Problems with LLMs?—0
Beyond Lines and Circles: Unveiling the Geometric Reasoning Gap in Large Language Models—0
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language ModelsCode9
Large Language Models for Mathematical Reasoning: Progresses and Challenges—0
Large Multi-Modal Models (LMMs) as Universal Foundation Models for AI-Native Wireless Systems—0
Efficient Tool Use with Chain-of-Abstraction Reasoning—0
GAPS: Geometry-Aware Problem Solver—0
EAGLE: Speculative Sampling Requires Rethinking Feature UncertaintyCode7
Demystifying Chains, Trees, and Graphs of Thoughts—0
Distilling Mathematical Reasoning Capabilities into Small Language Models—0
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in ChineseCode2
LangBridge: Multilingual Reasoning Without Multilingual SupervisionCode2
Knowledge Fusion of Large Language ModelsCode4
Evaluating LLMs' Mathematical and Coding Competency through Ontology-guided InterventionsCode1
Augmenting Math Word Problems via Iterative Question ComposingCode1
Show:102550
← PrevPage 13 of 17Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1XolverAcc94.4—Unverified
2DeepSeek-r1Acc79.8—Unverified
3Openai-o1Acc74.4—Unverified
4Openai-o1-miniAcc70—Unverified
5Search-o1Acc56.7—Unverified
6s1-32BAcc56.7—Unverified
7Openai-o1-previewAcc44.6—Unverified
8Qwen2.5-72B-InstructAcc23.3—Unverified
9Claude3.5-SonnetAcc16—Unverified
#ModelMetricClaimedVerifiedStatus
1o3Accuracy0.25—Unverified
2Gemini 1.5 Pro (002)Accuracy0.02—Unverified
3GPT-4oAccuracy0.01—Unverified
4o1-miniAccuracy0.01—Unverified
5o1-previewAccuracy0.01—Unverified
6Claude 3.5 SonnetAccuracy0.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.6—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.48—Unverified
3Neo-P (Fine-tuned, 2.7B)Accuracy0.39—Unverified
4GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
5Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.25—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.59—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.45—Unverified
3GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
4Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.27—Unverified
5Neo-P (Fine-tuned, 2.7B)Accuracy0.24—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.18—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDCompletion accuracy65.8—Unverified
2PGPSNetCompletion accuracy62.7—Unverified
3GAPSCompletion accuracy61.2—Unverified
4Inter-GPSCompletion accuracy59.8—Unverified
5GeoformerCompletion accuracy35.6—Unverified
6NGSCompletion accuracy34.1—Unverified
#ModelMetricClaimedVerifiedStatus
1QWQ-32B-previewAcc82.5—Unverified
2Math-MasterAcc82—Unverified
3Qwen2.5-Math-7B-instructAcc62.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)75.2—Unverified
2GAPSAccuracy (%)67.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Search-o1Acc86.4—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)98.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GAPSAccuracy (%)97.5—Unverified