SOTAVerified

GSM8K

Papers

Showing 176–200 of 439 papers

TitleStatusHype
Evolutionary Pre-Prompt Optimization for Mathematical Reasoning—0
Evaluation of LLMs for mathematical problem solving—0
Complexity-Based Prompting for Multi-Step Reasoning—0
Advancing Process Verification for Large Language Models via Tree-Based Preference Learning—0
Entropy-Guided Watermarking for LLMs: A Test-Time Framework for Robust and Traceable Text Generation—0
MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs—0
Enhancing Reasoning Capabilities of Small Language Models with Blueprints and Prompt Template Search—0
AutoJudge: Judge Decoding Without Manual Annotation—0
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning—0
Elastic Weight Consolidation for Full-Parameter Continual Pre-Training of Gemma2—0
Adaptive Inference-Time Compute: LLMs Can Predict if They Can Do Better, Even Mid-Generation—0
MathFimer: Enhancing Mathematical Reasoning by Expanding Reasoning Steps through Fill-in-the-Middle Task—0
Efficient Fine-Tuning of Quantized Models via Adaptive Rank and Bitwidth—0
Efficient Data Selection at Scale via Influence Distillation—0
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference—0
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection—0
LLaMa-SciQ: An Educational Chatbot for Answering Science MCQ—0
Dynamic Parallel Tree Search for Efficient LLM Reasoning—0
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models—0
LiteSearch: Efficacious Tree Search for LLM—0
Assessing the Impact of Prompting Methods on ChatGPT's Mathematical Capabilities—0
Leveraging Uncertainty Estimation for Efficient LLM Routing—0
Dynamic Subset Tuning: Expanding the Operational Range of Parameter-Efficient Training for Large Language Models—0
Let's reward step by step: Step-Level reward model as the Navigators for Reasoning—0
MathDivide: Improved mathematical reasoning by large language models—0
Show:102550
← PrevPage 8 of 18Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1XolverAccuracy98.1—Unverified
2Orange-mini0-shot MRR98—Unverified