SOTAVerified

Natural Language Visual Grounding

Papers

Showing 11–20 of 32 papers

TitleStatusHype
Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI AgentsCode3
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI AgentsCode3
GUICourse: From General Vision Language Models to Versatile GUI AgentsCode2
Improved GUI Grounding via Iterative NarrowingCode1
Localizing Moments in Long Video Via Multimodal GuidanceCode1
Belief Revision based Caption Re-ranker with Visual Semantic InformationCode1
TubeDETR: Spatio-Temporal Video Grounding with TransformersCode1
CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation TasksCode1
Panoptic Narrative GroundingCode1
Panoptic Narrative GroundingCode1
Show:102550
← PrevPage 2 of 4Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1UGround-V1-7BAccuracy (%)86.34—Unverified
2Aguvis-7BAccuracy (%)83—Unverified
3OS-Atlas-Base-7BAccuracy (%)82.47—Unverified
4Aria-UIAccuracy (%)81.1—Unverified
5Aguvis-G-7BAccuracy (%)81—Unverified
6UGround-V1-2BAccuracy (%)77.67—Unverified
7ShowUIAccuracy (%)75.1—Unverified
8ShowUI-GAccuracy (%)75—Unverified
9UGroundAccuracy (%)73.3—Unverified
10OmniParserAccuracy (%)73—Unverified