SOTAVerified

Benchmarking

Papers

Showing 40714080 of 5548 papers

TitleStatusHype
Benchmarking Active Learning Strategies for Materials Optimization and Discovery0
A critical analysis of metrics used for measuring progress in artificial intelligence0
True Online TD-Replan(lambda) Achieving Planning through Replaying0
Benchmarking Active Learning for NILM0
Benchmarking Abstractive Summarisation: A Dataset of Human-authored Summaries of Norwegian News Articles0
Parsing Any Domain English text to CoNLL dependencies0
Trust but Verify: Programmatic VLM Evaluation in the Wild0
Participatory Personalization in Classification0
'Part'ly first among equals: Semantic part-based benchmarking for state-of-the-art object recognition systems0
When Safety Detectors Aren't Enough: A Stealthy and Effective Jailbreak Attack on LLMs via Steganographic Techniques0
Show:102550
← PrevPage 408 of 555Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1GPT-4 TurboACC0.56Unverified