SOTAVerified

Language Model Evaluation

The task of using LLMs as evaluators of large language and vision language models.

Papers

Showing 31–40 of 69 papers

TitleStatusHype
Mind the Gap: Assessing Temporal Generalization in Neural Language Models—0
Predicting Liquidity-Aware Bond Yields using Causal GANs and Deep Reinforcement Learning with LLM Evaluation—0
Pseudointelligence: A Unifying Framework for Language Model Evaluation—0
R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation—0
Rethinking Generative Large Language Model Evaluation for Semantic Comprehension—0
Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation—0
Stratified Prediction-Powered Inference for Hybrid Language Model Evaluation—0
UPME: An Unsupervised Peer Review Framework for Multimodal Large Language Model Evaluation—0
ViDAS: Vision-based Danger Assessment and Scoring—0
KMMLU: Measuring Massive Multitask Language Understanding in Korean—0
Show:102550
← PrevPage 4 of 7Next →

No leaderboard results yet.