SOTAVerified

Object Localization

Object Localization is the task of locating an instance of a particular object category in an image, typically by specifying a tightly cropped bounding box centered on the instance. An object proposal specifies a candidate bounding box, and an object proposal is said to be a correct localization if it sufficiently overlaps a human-labeled “ground-truth” bounding box for the given object. In the literature, the “Object Localization” task is to locate one instance of an object category, whereas “object detection” focuses on locating all instances of a category in a given image.

Source: Fast On-Line Kernel Density Estimation for Active Object Localization

Papers

Showing 1–50 of 617 papers

TitleStatusHype
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval—0
VoteSplat: Hough Voting Gaussian Splatting for 3D Scene Understanding—0
RAG-6DPose: Retrieval-Augmented 6D Pose Estimation via Leveraging CAD as Knowledge Base—0
CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion—0
UAV Object Detection and Positioning in a Mining Industrial Metaverse with Custom Geo-Referenced Data—0
WoMAP: World Models For Embodied Open-Vocabulary Object Localization—0
Multispectral Detection Transformer with Infrared-Centric Sensor FusionCode0
Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels—0
Towards Omnidirectional Reasoning with 360-R1: A Dataset, Benchmark, and GRPO-based Method—0
PointArena: Probing Multimodal Grounding Through Language-Guided Pointing—0
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous DrivingCode1
Towards Accurate State Estimation: Kalman Filter Incorporating Motion Dynamics for 3D Multi-Object Tracking—0
Enhancing Satellite Object Localization with Dilated Convolutions and Attention-aided Spatial PoolingCode0
Split Matching for Inductive Zero-shot Semantic Segmentation—0
Pro2SAM: Mask Prompt to SAM with Grid Points for Weakly Supervised Object Localization—0
Exploring Modality Guidance to Enhance VFM-based Feature Fusion for UDA in 3D Semantic Segmentation—0
Locate 3D: Real-World Object Localization via Self-Supervised Learning in 3DCode3
CFIS-YOLO: A Lightweight Multi-Scale Fusion Network for Edge-Deployable Wood Defect Detection—0
SoccerNet-v3D: Leveraging Sports Broadcast Replays for 3D Scene UnderstandingCode1
Foundation Models for Remote Sensing: An Analysis of MLLMs for Object Localization—0
Multi-Object Grounding via Hierarchical Contrastive Siamese Transformers—0
POEM: Precise Object-level Editing via MLLM control—0
MB-ORES: A Multi-Branch Object Reasoner for Visual Grounding in Remote SensingCode0
Texture or Semantics? Vision-Language Models Get Lost in Font RecognitionCode0
PixelCAM: Pixel Class Activation Mapping for Histology Image Classification and ROI LocalizationCode0
GLRD: Global-Local Collaborative Reason and Debate with PSL for 3D Open-Vocabulary Detection—0
Beyond Object Categories: Multi-Attribute Reference Understanding for Visual Grounding—0
xMOD: Cross-Modal Distillation for 2D/3D Multi-Object Discovery from 2D motionCode0
Omnidirectional Multi-Object TrackingCode2
Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding Registration—0
CrossOver: 3D Scene Cross-Modal AlignmentCode3
Qwen2.5-VL Technical ReportCode11
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval—0
Auto-Prompting SAM for Weakly Supervised Landslide Extraction—0
TeD-Loc: Text Distillation for Weakly Supervised Object LocalizationCode0
Neuromorphic Optical Tracking and Imaging of Randomly Moving Targets through Strongly Scattering Media—0
AuxDepthNet: Real-Time Monocular 3D Object Detection with Depth-Sensitive Features—0
Cross-Modal Distillation for 2D/3D Multi-Object Discovery from 2D Motion—0
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object LocalizationCode0
Demystifying the Potential of ChatGPT-4 Vision for Construction Progress Monitoring—0
SuperGSeg: Open-Vocabulary 3D Segmentation with Structured Super-Gaussians—0
Agent Journey Beyond RGB: Unveiling Hybrid Semantic-Spatial Environmental Representations for Vision-and-Language NavigationCode1
3D Spatial Understanding in MLLMs: Disambiguation and Evaluation—0
RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of ExpertsCode1
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding—0
GraPix: Exploring Graph Modularity Optimization for Unsupervised Pixel ClusteringCode0
RELOCATE: A Simple Training-Free Baseline for Visual Query Localization Using Region-Based Representations—0
SpaRC: Sparse Radar-Camera Fusion for 3D Object DetectionCode0
ObjectRelator: Enabling Cross-View Object Relation Understanding in Ego-Centric and Exo-Centric Videos—0
GloFinder: AI-empowered QuPath Plugin for WSI-level Glomerular Detection, Visualization, and Curation—0
Show:102550
← PrevPage 1 of 13Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1OSMaNRGSPL32.99—Unverified
2SUSARGSPL27.31—Unverified
3ShanksRGSPL22.85—Unverified
4CVPR22RGSPL22.06—Unverified
5damm1RGSPL15.96—Unverified
61637RGSPL14.03—Unverified
7init. PREVALENTRGSPL13.51—Unverified
8AirbertRGSPL13.28—Unverified
9init. OSCARRGSPL10—Unverified
10SIARGSPL9.2—Unverified
#ModelMetricClaimedVerifiedStatus
1VoxelNetAP89.35—Unverified
2VoxelNetAP89.35—Unverified
3Frustum PointNetsAP88.7—Unverified
4Frustum PointNetsAP81.2—Unverified
5VoxelNetAP77.47—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustrum-PointPillarsAP48.3—Unverified
2Frustum PointNetsAP47.2—Unverified
3Frustum PointNetsAP40.23—Unverified
4VoxelNetAP38.11—Unverified
5VoxelNetAP31.51—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustrum-PointPillarsAP52.23—Unverified
2Frustum PointNetsAP50.22—Unverified
3Frustum PointNetsAP42.15—Unverified
4VoxelNetAP40.74—Unverified
5VoxelNetAP33.69—Unverified
#ModelMetricClaimedVerifiedStatus
1VoxelNetAP77.39—Unverified
2Frustum PointNetsAP75.33—Unverified
3Frustum PointNetsAP62.19—Unverified
4VoxelNetAP57.73—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustum PointNetsAP75.38—Unverified
2Frustum PointNetsAP71.96—Unverified
3VoxelNetAP66.7—Unverified
4VoxelNetAP61.22—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustum PointNetsAP61.96—Unverified
2Frustum PointNetsAP56.77—Unverified
3VoxelNetAP54.76—Unverified
4VoxelNetAP48.36—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustum PointNetsAP58.09—Unverified
2Frustum PointNetsAP51.21—Unverified
3VoxelNetAP46.13—Unverified
4VoxelNetAP39.48—Unverified
#ModelMetricClaimedVerifiedStatus
1Unified-IOXLLocalization (ablation)67—Unverified
2GPV-2Localization (ablation)53.6—Unverified
3Mask R-CNNLocalization (ablation)44.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustum PointNetsAP54.68—Unverified
2VoxelNeAP50.55—Unverified
3Frustum PointNetsAP50.39—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT4-Vision 4-shot+CoTAccuracy49.7—Unverified
2Gemini-Pro 4-shot+CoTAccuracy33.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustum PointNetsAP84—Unverified
2VoxelNetAP79.26—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustrum-PointPillarsAP60.98—Unverified
#ModelMetricClaimedVerifiedStatus
1Hausdorff LossPrecision88.1—Unverified
#ModelMetricClaimedVerifiedStatus
1oursCorLoc41.2—Unverified
#ModelMetricClaimedVerifiedStatus
1oursCorLoc47.45—Unverified
#ModelMetricClaimedVerifiedStatus
1Hausdorff LossF-Score88.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Hausdorff LossRecall89.2—Unverified