SOTAVerified

Object Localization

Object Localization is the task of locating an instance of a particular object category in an image, typically by specifying a tightly cropped bounding box centered on the instance. An object proposal specifies a candidate bounding box, and an object proposal is said to be a correct localization if it sufficiently overlaps a human-labeled “ground-truth” bounding box for the given object. In the literature, the “Object Localization” task is to locate one instance of an object category, whereas “object detection” focuses on locating all instances of a category in a given image.

Source: Fast On-Line Kernel Density Estimation for Active Object Localization

Papers

Showing 51–100 of 617 papers

TitleStatusHype
Probing the Mid-level Vision Capabilities of Self-Supervised Learning—0
OCDet: Object Center Detection via Bounding Box-Aware Heatmap Prediction on Edge Devices with NPUsCode1
Time is on my sight: scene graph filtering for dynamic environment perception in an LLM-driven robot—0
FAST-Splat: Fast, Ambiguity-Free Semantics Transfer in Gaussian Splatting—0
YCB-LUMA: YCB Object Dataset with Luminance Keying for Object LocalizationCode0
Text-guided Zero-Shot Object Localization—0
Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning—0
DynaMem: Online Dynamic Spatio-Semantic Memory for Open World Mobile ManipulationCode3
Upsampling DINOv2 features for unsupervised vision tasks and weakly supervised materials segmentationCode1
LUDVIG: Learning-free Uplifting of 2D Visual features to Gaussian Splatting scenes—0
Co-Segmentation without any Pixel-level Supervision with Application to Large-Scale Sketch ClassificationCode0
Optimizing Multi-Task Learning for Accurate Spacecraft Pose Estimation—0
Training-Free Open-Ended Object Detection and Segmentation via Attention as Prompts—0
PuzzleBoard: A New Camera Calibration Pattern with Position EncodingCode1
A Novel Unified Architecture for Low-Shot Counting by Detection and SegmentationCode2
DIAL: Dense Image-text ALignment for Weakly Supervised Semantic Segmentation—0
QUB-PHEO: A Visual-Based Dyadic Multi-View Dataset for Intention Inference in Collaborative AssemblyCode0
PMR-Net: Parallel Multi-Resolution Encoder-Decoder Network Framework for Medical Image Segmentation—0
Do Pre-trained Vision-Language Models Encode Object States?Code0
Top-GAP: Integrating Size Priors in CNNs for more Interpretability, Robustness, and Bias Mitigation—0
Prediction Accuracy & Reliability: Classification and Object Localization under Distribution Shift—0
Evaluation and Comparison of Visual Language Models for Transportation Engineering ProblemsCode0
Multi-scale Multi-instance Visual Sound Localization and Segmentation—0
Language-guided Scale-aware MedSegmentor for Lesion Segmentation in Medical Imaging—0
Optimal Weight Scheme for Fusion-Assisted Cooperative Multi-Monostatic Object Localization in 6G Networks—0
Multi-Beam Object-Localization for Millimeter-Wave ISAC-Aided Connected Autonomous Vehicles—0
MambaEVT: Event Stream based Visual Object Tracking using State Space ModelCode1
Stimulating Imagination: Towards General-purpose Object Rearrangement—0
Categorical Knowledge Fused Recognition: Fusing Hierarchical Knowledge with Image Classification through Aligning and Deep Metric Learning—0
A Model Generalization Study in Localizing Indoor Cows with COw LOcalization (COLO) dataset—0
BIV-Priv-Seg: Locating Private Content in Images Taken by People With Visual Impairments—0
PEEKABOO: Hiding parts of an image for unsupervised object localizationCode0
DenseTrack: Drone-based Crowd Tracking via Density-aware Motion-appearance SynergyCode0
Evaluating and Enhancing Trustworthiness of LLMs in Perception Tasks—0
Global-Local Collaborative Inference with LLM for Lidar-Based Open-Vocabulary DetectionCode1
Leveraging Transformers for Weakly Supervised Object Localization in Unconstrained VideosCode0
ALINA: Advanced Line Identification and Notation AlgorithmCode0
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language TasksCode5
FlexLoc: Conditional Neural Networks for Zero-Shot Sensor Perspective Invariance in Object Localization with Distributed Multimodal SensorsCode0
Leveraging Activations for Superpixel Explanations—0
Deep Learning Innovations for Underwater Waste Detection: An In-Depth AnalysisCode1
Concept Visualization: Explaining the CLIP Multi-modal Embedding Using WordNetCode0
Explaining Multi-modal Large Language Models by Analyzing their Vision PerceptionCode0
Many-Shot In-Context Learning in Multimodal Foundation ModelsCode2
Masked Multi-Query Slot Attention for Unsupervised Object DiscoveryCode0
Source-Free Domain Adaptation of Weakly-Supervised Object Localization Models for HistologyCode0
Mamba-FETrack: Frame-Event Tracking via State Space ModelCode4
Equivariant Spatio-Temporal Self-Supervision for LiDAR Object Detection—0
A Realistic Protocol for Evaluation of Weakly Supervised Object LocalizationCode0
Real-world Instance-specific Image Goal Navigation: Bridging Domain Gaps via Contrastive Learning—0
Show:102550
← PrevPage 2 of 13Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1OSMaNRGSPL32.99—Unverified
2SUSARGSPL27.31—Unverified
3ShanksRGSPL22.85—Unverified
4CVPR22RGSPL22.06—Unverified
5damm1RGSPL15.96—Unverified
61637RGSPL14.03—Unverified
7init. PREVALENTRGSPL13.51—Unverified
8AirbertRGSPL13.28—Unverified
9init. OSCARRGSPL10—Unverified
10SIARGSPL9.2—Unverified
#ModelMetricClaimedVerifiedStatus
1VoxelNetAP89.35—Unverified
2VoxelNetAP89.35—Unverified
3Frustum PointNetsAP88.7—Unverified
4Frustum PointNetsAP81.2—Unverified
5VoxelNetAP77.47—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustrum-PointPillarsAP48.3—Unverified
2Frustum PointNetsAP47.2—Unverified
3Frustum PointNetsAP40.23—Unverified
4VoxelNetAP38.11—Unverified
5VoxelNetAP31.51—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustrum-PointPillarsAP52.23—Unverified
2Frustum PointNetsAP50.22—Unverified
3Frustum PointNetsAP42.15—Unverified
4VoxelNetAP40.74—Unverified
5VoxelNetAP33.69—Unverified
#ModelMetricClaimedVerifiedStatus
1VoxelNetAP77.39—Unverified
2Frustum PointNetsAP75.33—Unverified
3Frustum PointNetsAP62.19—Unverified
4VoxelNetAP57.73—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustum PointNetsAP75.38—Unverified
2Frustum PointNetsAP71.96—Unverified
3VoxelNetAP66.7—Unverified
4VoxelNetAP61.22—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustum PointNetsAP61.96—Unverified
2Frustum PointNetsAP56.77—Unverified
3VoxelNetAP54.76—Unverified
4VoxelNetAP48.36—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustum PointNetsAP58.09—Unverified
2Frustum PointNetsAP51.21—Unverified
3VoxelNetAP46.13—Unverified
4VoxelNetAP39.48—Unverified
#ModelMetricClaimedVerifiedStatus
1Unified-IOXLLocalization (ablation)67—Unverified
2GPV-2Localization (ablation)53.6—Unverified
3Mask R-CNNLocalization (ablation)44.7—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustum PointNetsAP54.68—Unverified
2VoxelNeAP50.55—Unverified
3Frustum PointNetsAP50.39—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT4-Vision 4-shot+CoTAccuracy49.7—Unverified
2Gemini-Pro 4-shot+CoTAccuracy33.9—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustum PointNetsAP84—Unverified
2VoxelNetAP79.26—Unverified
#ModelMetricClaimedVerifiedStatus
1Frustrum-PointPillarsAP60.98—Unverified
#ModelMetricClaimedVerifiedStatus
1Hausdorff LossPrecision88.1—Unverified
#ModelMetricClaimedVerifiedStatus
1oursCorLoc41.2—Unverified
#ModelMetricClaimedVerifiedStatus
1oursCorLoc47.45—Unverified
#ModelMetricClaimedVerifiedStatus
1Hausdorff LossF-Score88.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Hausdorff LossRecall89.2—Unverified