SOTAVerified

Pose Estimation

Pose Estimation is a computer vision task where the goal is to detect the position and orientation of a person or an object. Usually, this is done by predicting the location of specific keypoints like hands, head, elbows, etc. in case of Human Pose Estimation.

A common benchmark for this task is MPII Human Pose

( Image credit: Real-time 2D Multi-Person Pose Estimation on CPU: Lightweight OpenPose )

Papers

Showing 101–150 of 4228 papers

TitleStatusHype
Progressive Inertial Poser: Progressive Real-Time Kinematic Chain Estimation for 3D Full-Body Pose from Three IMU Sensors—0
Pose Estimation for Intra-cardiac Echocardiography Catheter via AI-Based Anatomical Understanding—0
Comparison of Visual Trackers for Biomechanical Analysis of Running—0
HDiffTG: A Lightweight Hybrid Diffusion-Transformer-GCN Architecture for 3D Human Pose EstimationCode0
One2Any: One-Reference 6D Pose Estimation for Any Object—0
LiftFeat: 3D Geometry-Aware Local Feature MatchingCode3
Polar Coordinate-Based 2D Pose Prior with Neural Distance FieldCode0
Artificial Behavior Intelligence: Technology, Challenges, and Future Directions—0
6D Pose Estimation on Spoons and Hands—0
Dance of Fireworks: An Interactive Broadcast Gymnastics Training System Based on Pose Estimation—0
Finger Pose Estimation for Under-screen Fingerprint SensorCode0
Corr2Distrib: Making Ambiguous Correspondences an Ally to Predict Reliable 6D Pose Distributions—0
A Birotation Solution for Relative Pose Problems—0
Continuous Normalizing Flows for Uncertainty-Aware Human Pose Estimation—0
Near-field 5D Pose Estimation using Reconfigurable Intelligent Surfaces—0
PosePilot: Steering Camera Pose for Generative World Models with Self-supervised Depth—0
AquaGS: Fast Underwater Scene Reconstruction with SfM-Free Gaussian Splatting—0
3D Human Pose Estimation via Spatial Graph Order Attention and Temporal Body Aware TransformerCode0
T-Graph: Enhancing Sparse-view Camera Pose Estimation by Pairwise Translation Graph—0
InterLoc: LiDAR-based Intersection Localization using Road Segmentation with Automated Evaluation Method—0
Are Minimal Radial Distortion Solvers Really Necessary for Relative Pose Estimation?Code0
Dietary Intake Estimation via Continuous 3D Reconstruction of Food—0
Self-Supervised Monocular Visual Drone Model Identification through Improved Occlusion Handling—0
Adept: Annotation-Denoising Auxiliary Tasks with Discrete Cosine Transform Map and Keypoint for Human-Centric Pretraining—0
Large-scale visual SLAM for in-the-wild videos—0
A Survey on Event-based Optical Marker Systems—0
Transformation & Translation Occupancy Grid Mapping: 2-Dimensional Deep Learning Refined SLAM—0
Category-Level and Open-Set Object Pose Estimation for Robotics—0
GAN-SLAM: Real-Time GAN Aided Floor Plan Creation Through SLAM—0
SSD-Poser: Avatar Pose Estimation with State Space Duality from Sparse Observations—0
Assessing the Feasibility of Internet-Sourced Video for Automatic Cattle Lameness Detection—0
SmallGS: Gaussian Splatting-based Camera Pose Estimation for Small-Baseline Videos—0
SignX: The Foundation Model for Sign Recognition—0
Vision6D: 3D-to-2D Interactive Visualization and Annotation Tool for 6D Pose EstimationCode2
Instance-Adaptive Keypoint Learning with Local-to-Global Geometric Aggregation for Category-Level Object Pose Estimation—0
Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMsCode2
Back on Track: Bundle Adjustment for Dynamic Scene Reconstruction—0
Mono3R: Exploiting Monocular Cues for Geometric 3D Reconstruction—0
Imitation Learning with Precisely Labeled Human Demonstrations—0
ODHSR: Online Dense 3D Reconstruction of Humans and Scenes from Monocular Videos—0
Unsupervised Cross-Domain 3D Human Pose Estimation via Pseudo-Label-Guided Global Transforms—0
ViTa-Zero: Zero-shot Visuotactile Object 6D Pose Estimation—0
CoMotion: Concurrent Multi-person 3D MotionCode3
MobilePoser: Real-Time Full-Body Pose Estimation and 3D Human Translation from IMUs in Mobile Consumer DevicesCode2
An Online Adaptation Method for Robust Depth Estimation and Visual Odometry in the Open WorldCode0
Regist3R: Incremental Registration with Stereo Foundation Model—0
Diffusion Based Robust LiDAR Place Recognition—0
DMAGaze: Gaze Estimation Based on Feature Disentanglement and Multi-Scale Attention—0
CAP-Net: A Unified Network for 6D Pose and Size Estimation of Categorical Articulated Parts from a Single RGB-D Image—0
Differentially Private 2D Human Pose Estimation—0
Show:102550
← PrevPage 3 of 85Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1yoloposeAP5090.3—Unverified
2ViTPose (ViTAE-G, ensemble)AP81.1—Unverified
3ViTPose (ViTAE-G)AP80.9—Unverified
4PoseBH-HAP79.5—Unverified
5UDP-Pose-PSA(384x288)AP79.5—Unverified
64xRSN-50 (ensemble)AP79.2—Unverified
7UDP-Pose-PSA(256x192)AP78.9—Unverified
8CCM+AP78.9—Unverified
94xRSN-50AP78.6—Unverified
10PCT (256x256)AP78.3—Unverified
#ModelMetricClaimedVerifiedStatus
1PCT (swin-l, test set)PCKh-0.594.3—Unverified
2Soft-gated Skip ConnectionsPCKh-0.594.1—Unverified
3Cascade Feature AggregationPCKh-0.593.9—Unverified
4PCT (swin-b, test set)PCKh-0.593.8—Unverified
5TransPosePCKh-0.593.5—Unverified
6UniHCP (FT)PCKh-0.593.2—Unverified
74xRSN-50PCKh-0.593—Unverified
8UniPosePCKh-0.592.7—Unverified
9MSPNPCKh-0.592.6—Unverified
10Spatial ContextPCKh-0.592.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ViTPose (ViTAE-G, GT bounding boxes)Test AP93.3—Unverified
2UniHCP (direct eval)Test AP87.4—Unverified
3PoseBH-HTest AP87—Unverified
4RTMPose(RTMPose-l, GT bounding boxes)Test AP80.3—Unverified
5TransPose-HValidation AP62.3—Unverified
6BBox-Mask-Pose 2xTest AP48.3—Unverified
7BUCTD (CID-W32)Test AP47.2—Unverified
8HQNet (ViT-L)Test AP45.6—Unverified
9MaskPose-bTest AP45—Unverified
10CID (HRNet-W48)Test AP45—Unverified
#ModelMetricClaimedVerifiedStatus
1OmniPosePCK99.5—Unverified
2Soft-gated Skip ConnectionsPCK94.8—Unverified
3Residual Hourglass + ASR + AHOPCK94.5—Unverified
4UniPosePCK94.5—Unverified
5Chou et al. arXiv'17PCK94—Unverified
6Pyramid Residual Modules (PRMs)PCK93.9—Unverified
7Stacked hourglass + Inception-resnetPCK93.9—Unverified
8Multi-Context AttentionPCK92.6—Unverified
9FPDPCK90.8—Unverified
10Part heatmap regression (ResNet-152)PCK90.7—Unverified
#ModelMetricClaimedVerifiedStatus
1BUCTD-W48 (w/cond. input from PETR, and generative sampling)AP78.5—Unverified
2ViTPose-GAP78.3—Unverified
3BUCTD-W48 (w/cond. input from PETR)AP76.7—Unverified
4SwinV2-L 1K-MIMAP75.5—Unverified
5SwinV2-B 1K-MIMAP74.9—Unverified
6BUCTD-W48AP72.9—Unverified
7OpenPifPafAP70.5—Unverified
8MIPNet (HRNet-W48)AP70—Unverified
9KAPAO-LAP68.9—Unverified
10KAPAO-MAP67.1—Unverified
#ModelMetricClaimedVerifiedStatus
1CCNet (ViTPose-B_GT-bbox_256x192)AP78.1—Unverified
2MogaNet-B (384x288)AP77.3—Unverified
3ViTPose-B (Single-task_GT-bbox_256x192)AP77.3—Unverified
4MogaNet-S (384x288)AP76.4—Unverified
5Bias (HRNet_256x192)AP75.8—Unverified
6ViTPose-B (Single-task_Det-bbox_256x192)AP75.8—Unverified
7HRNet (256x192)AP75.3—Unverified
8MogaNet-S (256x192)AP74.9—Unverified
9MogaNet-T (256x192)AP73.2—Unverified
10RLE (256x192)AP71.3—Unverified
#ModelMetricClaimedVerifiedStatus
1Hulk(Finetune, ViT-L)AP37.1—Unverified
2Hulk(Finetune, ViT-B)AP35.6—Unverified
3HRFormer (HRFomer-B)AP34.4—Unverified
4UniHCP (finetune)AP33.6—Unverified
5HRNet (HRNet-w48 )AP33.5—Unverified
6HRNet (HRNet-w32)AP32.3—Unverified
7HRFormer (HRFomer-S)AP31.6—Unverified
8SimpleBaseline (ResNet-152)AP29.9—Unverified
9SimpleBaseline (ResNet-101)AP29.4—Unverified
10SimpleBaseline (ResNet-50)AP28—Unverified
#ModelMetricClaimedVerifiedStatus
1BUCTD (PETR, with generative sampling)APL83.7—Unverified
2OmniPose (WASPv2)AP79.5—Unverified
3MetaPrompt-SDAP79—Unverified
4Hulk(Finetune, ViT-L)AP78.7—Unverified
5BUCTD (PETR, with generative sampling)AP77.8—Unverified
6Hulk(Finetune, ViT-B)AP77.5—Unverified
7I²R-Net (1st stage:HRFormer-B)AP77.3—Unverified
8PATH (Partial FT)AP77.1—Unverified
9SOLIDER (swin-B)AP76.6—Unverified
10PEFORMER-Xcit-dino-p8AP72.6—Unverified
#ModelMetricClaimedVerifiedStatus
1GIM-DKM[email protected],10°57.1—Unverified
2GIM-LoFTR[email protected],10°54.5—Unverified
3GIM-SuperGlue[email protected],10°53.5—Unverified
4DKM[email protected],10°51.5—Unverified
5SuperGlue[email protected],10°49—Unverified
6LoFTR[email protected],10°47.5—Unverified
#ModelMetricClaimedVerifiedStatus
1AdaPoseMean mAP93.38—Unverified
2DECA-D3Mean mAP88.75—Unverified
3V2V-PoseNetMean mAP88.74—Unverified
4A2JMean mAP88—Unverified
5RENMean mAP84.9—Unverified
6Multi-task learning + viewpoint invarianceMean mAP77.4—Unverified
#ModelMetricClaimedVerifiedStatus
1SimpleBaseline + HANetMean [email protected]99.6—Unverified
2DeciWatchMean [email protected]99—Unverified
3LSTM PMMean [email protected]93.6—Unverified
4CPMMean [email protected]91.9—Unverified
5UniTrack_i18Mean [email protected]80.5—Unverified
#ModelMetricClaimedVerifiedStatus
14xRSN-50[email protected]93—Unverified
2Refine[email protected]92.1—Unverified
3EfficientPose IV[email protected]91.2—Unverified
4OpenPose[email protected]88.8—Unverified
5Adversarial Learning[email protected]88.6—Unverified
#ModelMetricClaimedVerifiedStatus
1OmniPoseMean [email protected]99.4—Unverified
2UniPose-LSTMMean [email protected]99.3—Unverified
3LSTM PMMean [email protected]97.7—Unverified
4Thin-SlicingMean [email protected]96.5—Unverified
5Iqbal et al.Mean [email protected]81.1—Unverified
#ModelMetricClaimedVerifiedStatus
1DP-RCNN-DeepLab (ResNet-101)AP68—Unverified