SOTAVerified

Mathematical Reasoning

Papers

Showing 426–450 of 805 papers

TitleStatusHype
Applying RLAIF for Code Generation with API-usage in Lightweight LLMs—0
Apriori Knowledge in an Era of Computational Opacity: The Role of AI in Mathematical Discovery—0
Are Large Language Models Robust in Understanding Code Against Semantics-Preserving Mutations?—0
Assessing GPT4-V on Structured Reasoning Tasks—0
Evaluating LLMs' Mathematical Reasoning in Financial Document Question Answering—0
Assessing Robustness to Spurious Correlations in Post-Training Language Models—0
Assessing the Emergent Symbolic Reasoning Abilities of Llama Large Language Models—0
Assessing the Impact of Prompting Methods on ChatGPT's Mathematical Capabilities—0
A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges—0
A Survey on Large Language Models for Mathematical Reasoning—0
A Symbolic Framework for Evaluating Mathematical Reasoning and Generalisation with Transformers—0
A Systematic Evaluation of Large Language Models for Natural Language Generation Tasks—0
A Systematic Survey on Large Language Models for Algorithm Design—0
A Technical Study into Small Reasoning Language Models—0
Augmenting In-Context-Learning in LLMs via Automatic Data Labeling and Refinement—0
AutoGeo: Automating Geometric Image Dataset Creation for Enhanced Geometry Understanding—0
AutoGPS: Automated Geometry Problem Solving via Multimodal Formalization and Deductive Reasoning—0
AutoMathKG: The automated mathematical knowledge graph based on LLM and vector database—0
Forward-Backward Reasoning in Large Language Models for Mathematical Verification—0
Basis Selection: Low-Rank Decomposition of Pretrained Large Language Models for Target Applications—0
Benchmarking Large Language Models via Random Variables—0
Benchmarking Large Language Models with Integer Sequence Generation Tasks—0
Better Process Supervision with Bi-directional Rewarding Signals—0
Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning—0
Beyond Captioning: Task-Specific Prompting for Improved VLM Performance in Mathematical Reasoning—0
Show:102550
← PrevPage 18 of 33Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1XolverAcc94.4—Unverified
2DeepSeek-r1Acc79.8—Unverified
3Openai-o1Acc74.4—Unverified
4Openai-o1-miniAcc70—Unverified
5Search-o1Acc56.7—Unverified
6s1-32BAcc56.7—Unverified
7Openai-o1-previewAcc44.6—Unverified
8Qwen2.5-72B-InstructAcc23.3—Unverified
9Claude3.5-SonnetAcc16—Unverified
#ModelMetricClaimedVerifiedStatus
1o3Accuracy0.25—Unverified
2Gemini 1.5 Pro (002)Accuracy0.02—Unverified
3GPT-4oAccuracy0.01—Unverified
4o1-miniAccuracy0.01—Unverified
5o1-previewAccuracy0.01—Unverified
6Claude 3.5 SonnetAccuracy0.01—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.6—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.48—Unverified
3Neo-P (Fine-tuned, 2.7B)Accuracy0.39—Unverified
4GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
5Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.25—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Codex (Few-Shot, 175B)Accuracy0.59—Unverified
2Bhāskara-P (Fine-tuned, 2.7B)Accuracy0.45—Unverified
3GPT-3 (Few-Shot, 175B)Accuracy0.38—Unverified
4Bhāskara-A (Fine-tuned, 2.7B)Accuracy0.27—Unverified
5Neo-P (Fine-tuned, 2.7B)Accuracy0.24—Unverified
6Neo-A (Fine-tuned, 2.7B)Accuracy0.18—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDCompletion accuracy65.8—Unverified
2PGPSNetCompletion accuracy62.7—Unverified
3GAPSCompletion accuracy61.2—Unverified
4Inter-GPSCompletion accuracy59.8—Unverified
5GeoformerCompletion accuracy35.6—Unverified
6NGSCompletion accuracy34.1—Unverified
#ModelMetricClaimedVerifiedStatus
1QWQ-32B-previewAcc82.5—Unverified
2Math-MasterAcc82—Unverified
3Qwen2.5-Math-7B-instructAcc62.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)75.2—Unverified
2GAPSAccuracy (%)67.8—Unverified
#ModelMetricClaimedVerifiedStatus
1Search-o1Acc86.4—Unverified
#ModelMetricClaimedVerifiedStatus
1GOLDAccuracy (%)98.5—Unverified
#ModelMetricClaimedVerifiedStatus
1GAPSAccuracy (%)97.5—Unverified