SOTAVerified

The Open Verification Layer for ML Research

Community benchmark tracking and reproducibility verification. Built for researchers and autonomous research agents.

510,095 papers251,776 code links4,818 tasks

Papers

Showing 301350 of 510095 papers

TitleStatusHype
Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction0
SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation0
Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts0
JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation0
LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design0
Verifiable Knowledge Expansion through Retrieval-Grounded Formal Concept Analysis0
Scene-Conditioned PINN-GNN for Multipath RF Maps: Cross-Scene Generation and In-Scene Completion0
SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video0
EHHN: An Event-driven Heterogeneous Hypergraph Network for Object-Centric Next Activity Prediction0
EPnG: Adaptive Expert Prune-and-Grow for Parameter-Efficient MoE Fine-tuning0
PARTREP: Learning What to Repeat for Decoder-only LLMs0
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification0
Lightweight Safe Reinforcement Learning for End-to-End UAV Navigation0
Single-Channel EEG-Based Cognitive Load Assessment in Online Learning: A Hybrid Deep Learning Approach0
Expander Sparse Autoencoders: Parameter-Efficient Dictionaries for Mechanistic Interpretability0
Do LLMs Truly Generalize in the Molecular Domain? A Perturbation-Based Analysis0
PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation0
Decoupling Code Complexity from Newcomer Participation: A Causal Study of AI Coding Agent Adoption in OSS0
MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models0
MMIR-TCM: Memory-Integrated Multimodal Inference and Retrieval for TCM Clinical Decision Support0
Koopman operator theory: fundamentals, control, and applications0
Self-Supervised Test-Time Tuning for Packet Loss Concealment0
Gaming Consensus: Coordinated Manipulation in Crowdsourced Fact-Checking0
Rethinking Conditional Generation for Underwater Salient Object Detection0
C2E: Boosting Ego-Only 3D Object Detection via Multi-Teacher Contrastive Knowledge Distillation0
Gender Differences in Research Topic and Method Selection in Library and Information Science: Perspectives from Three Top Journals0
Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference0
Non-synchronism in Global Usage of Research Methods in Library and Information Science from 1990 to 20190
Adaptive Group-Based Counterfactual Explanations for Time-Series Rehabilitation Data0
Actual causality in fault trees0
Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models0
CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training0
Decomposer: Learning to Decompile Symbolic Music to Programs0
Geometric Foundation Model Distillation for Efficient Lunar 3D Reconstruction0
Evaluating Chunking Strategies for Retrieval-Augmented Generation on Academic Texts0
Has This Checkpoint Been Abliterated? A Two-Signal Audit and Its Failure Map0
Safety Targeted Embedding Exploit via Refinement0
DL-SLAM: Enabling High-Fidelity Gaussian Splatting SLAM in Dynamic Environments based on Dual-Level Probability0
An Exploratory Study on LLM-Generated Code and Comments in Code Repositories0
QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers0
SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use0
SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models0
Learning the Supports for Categorical Critic in Reinforcement Learning0
PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation0
Diversity-aware View Partitioning for Scalable VGGT0
Spec-AUF: Accept-Until-Fail Training under Train-Inference Misalignment for Masked Block Drafters0
Regularized Variational and Spectral Log-Density-Ratio Estimation in the Gaussian Location Model0
Rank-Then-Act: Reward-Free Control from Frame-Order Progress0
FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation0
SABER: A Semantic-Aligned Brain Network Analysis Framework via Multi-scale Hypergraphs0
Show:102550
← PrevPage 7 of 10202Next →