SOTAVerified

MMLU

Papers

Showing 201–250 of 340 papers

TitleStatusHype
SSR: Alignment-Aware Modality Connector for Speech Language Models—0
Correctness Coverage Evaluation for Medical Multiple-Choice Question Answering Based on the Enhanced Conformal Prediction Framework—0
Step Guided Reasoning: Improving Mathematical Reasoning using Guidance Generation and Step Reasoning—0
SuperBPE: Space Travel for Language Models—0
Surface Fairness, Deep Bias: A Comparative Study of Bias in Language Models—0
SUTRA: Scalable Multilingual Language Model Architecture—0
Swallowing the Poison Pills: Insights from Vulnerability Disparity Among LLMs—0
Symbolic Mixture-of-Experts: Adaptive Skill-based Routing for Heterogeneous Reasoning—0
Take a Step Back: Evoking Reasoning via Abstraction in Large Language Models—0
TeacherLM: Teaching to Fish Rather Than Giving the Fish, Language Modeling Likewise—0
The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback—0
The Base-Rate Effect on LLM Benchmark Performance: Disambiguating Test-Taking Strategies from Benchmark Performance—0
The Claude 3 Model Family: Opus, Sonnet, Haiku—0
The Poison of Alignment—0
The Vulnerability of Language Model Benchmarks: Do They Accurately Reflect True LLM Performance?—0
Uncovering Latent Chain of Thought Vectors in Language Models—0
Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark—0
Towards Multilingual LLM Evaluation for European Languages—0
Towards Fully Exploiting LLM Internal States to Enhance Knowledge Boundary Perception—0
Towards Uncertainty-Aware Language Agent—0
Transcending Scaling Laws with 0.1% Extra Compute—0
Transferable text data distillation by trajectory matching—0
Triangulating LLM Progress through Benchmarks, Games, and Cognitive Tests—0
Understanding Finetuning for Factual Knowledge Extraction—0
Universality of Layer-Level Entropy-Weighted Quantization Beyond Model Architecture and Size—0
Unraveling Indirect In-Context Learning Using Influence Functions—0
Evaluating Mathematical Reasoning Across Large Language Models: A Fine-Grained Approach—0
Unveiling the Secret Recipe: A Guide For Supervised Fine-Tuning Small LLMs—0
Upcycling Large Language Models into Mixture of Experts—0
Biomed-Enriched: A Biomedical Dataset Enriched with LLMs for Pretraining and Extracting Rare and Hidden Content—0
Bilingual Evaluation of Language Models on General Knowledge in University Entrance Exams with Minimal Contamination—0
BrainTransformers: SNN-LLM—0
B-score: Detecting biases in large language models using response history—0
ChainRank-DPO: Chain Rank Direct Preference Optimization for LLM Rankers—0
Changing Answer Order Can Decrease MMLU Accuracy—0
MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation—0
Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning—0
Continuous Approximations for Improving Quantization Aware Training of LLMs—0
Correlating and Predicting Human Evaluations of Language Models from Natural Language Processing Benchmarks—0
Cost-aware LLM-based Online Dataset Annotation—0
Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning—0
Cost-Saving LLM Cascades with Early Abstention—0
CPL: Critical Plan Step Learning Boosts LLM Generalization in Reasoning Tasks—0
Critique-Guided Distillation: Improving Supervised Fine-tuning via Better Distillation—0
Cultural Conditioning or Placebo? On the Effectiveness of Socio-Demographic Prompting—0
AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection—0
GenBFA: An Evolutionary Optimization Approach to Bit-Flip Attacks on LLMs—0
Data Efficient Evaluation of Large Language Models and Text-to-Image Models via Adaptive Sampling—0
DEM: Distribution Edited Model for Training with Mixed Data Distributions—0
Detecting Benchmark Contamination Through Watermarking—0
Show:102550
← PrevPage 5 of 7Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1go ahead, make my dataFinal_score61.72—Unverified
2#GreedyCowFinal_score61.63—Unverified
3Don't Ask Us yFinal_score61.4—Unverified
4Data_and_ConfusedFinal_score60.96—Unverified
5WafflesFinal_score60.91—Unverified
6raakaFinal_score60.91—Unverified
7Team ProcrustinationFinal_score60.64—Unverified
8Axiom Consulting PartnersFinal_score60.63—Unverified
9Lets_Be_FairFinal_score60.23—Unverified
10goonersFinal_score60.22—Unverified
#ModelMetricClaimedVerifiedStatus
1Orange-mini0-shot MRR99.19—Unverified
#ModelMetricClaimedVerifiedStatus
1HybridBeam+SI-SDRi13.3—Unverified