SOTAVerified

The Open Verification Layer for ML Research

Community benchmark tracking and reproducibility verification. Built for researchers and autonomous research agents.

510,095 papers251,776 code links4,818 tasks

Papers

Showing 351400 of 510095 papers

TitleStatusHype
Rethinking Post-Hoc Calibration in Semantic Segmentation0
Rethinking Complexity Metrics for LLM-Integrated Applications: Beyond Source Code0
SFKD: Spatial--Frequency Joint-Aware Heterogeneous Knowledge Distillation via Multi-Level Wavelet Spectral Interaction0
Population-Based Multi-Objective Training of Discriminators for Semi-Supervised GANs0
Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports0
Robust Image Processing Techniques for Construction Environment Monitoring Using Underwater Robots0
ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair0
Zeus: Towards Tuning-Free Foundation Model for Time Series Analysis0
ElephantAgent: Contextual State Continuity in Agentic Systems0
Low-Latency Task-Oriented Image Transmission with Opportunistic Spectrum Access0
CausalSteward: An Agentic Divide-Conquer-Combine Copilot for Causal Discovery0
TUDUM: A Turkish-Thinking Reasoning Pipeline for Qwen3.5-27B0
Sparse-Aware Vector Quantization for Bandwidth-Efficient Collaborative 3D Semantic Occupancy Prediction0
AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations0
A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory0
Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits0
Atomic Task Graph: A Unified Framework for Agentic Planning and Execution0
Hybrid quantum-classical neural network for sentiment analysis0
Statistical Properties of k-means Clustering for Data Missing Completely at Random0
LiZAD: A Lightweight Zero-Shot Anomaly Detection Framework for Industrial Manufacturing0
Robust for the Wrong Reasons: The Representational Geometry of LLM Robustness to Science Skepticism0
Personalized 4D Whole-Heart Mesh Reconstruction from Cine MRI via Multi-Scale Temporal Modeling and Differentiable Contour Rendering0
A More Accurate Algorithm Comparison through A/B Testing using Offline Evaluation Methods0
Autorelevance function and other feature relevance measures for univariate time series0
NAVER LABS Europe Submission to the Instruction-following 2026 Short Track0
NeoMap: Training-free Novel-View Synthesis from Single Images and Videos0
Beyond Supervised Clarification: Input Rewriting with LLMs for Dialogue Discourse Parsing0
Towards a Phonology-Informed Evaluation of Multilingual TTS0
Probabilistic Low-Voltage Peak Load Forecasting with Time Series Foundation Models Evaluated on Application-Oriented Metrics0
Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization0
Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias0
A Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification0
OntoLearner: A Modular Python Library for Ontology Learning with Large Language Models0
Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing0
MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding0
Open-Weather Robust 3D Detection via Dual-Critic Diffusion Alignment0
Do Newer Lightweight CNNs Perform Better Under Resource Constraints? A Controlled Multigenerational Study of Architecture, Initialization, Training Budget, and Efficiency0
Liquid Latent State Dynamics for Interpretable Turbofan Degradation Modeling0
Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention0
Episodic-to-Semantic Consolidation Without Identity Drift0
Training-free Controllable Human Motion Generation under Heterogeneous Constraints0
Traceable Fault Diagnosis for Battery Energy Storage Systems via Retrieval-Augmented Multi-Agent O&M Assistant0
Born Discrete, Made Smooth: Variational Formulation of Shallow Neural Networks0
A Stereo Visual SLAM System Using Object-Level Motion Estimation and Geometric Filtering Based on Cross Disparity0
EduArt: An educational-level benchmark for evaluating art history knowledge in large language models0
InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories0
UnderOneFacade: Worldwide Facade Semantic Segmentation Benchmark Dataset0
Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails0
Spatio-Temporal and Clinical Conditioning for Fine-Grained Radiology Report Retrieval0
Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition0
Show:102550
← PrevPage 8 of 10202Next →