SOTAVerified

Spatial Reasoning

Papers

Showing 226–250 of 453 papers

TitleStatusHype
Tag Map: A Text-Based Map for Spatial Reasoning and Navigation with Large Language Models—0
Talking about the Moving Image: A Declarative Model for Image Schema Based Embodied Perception Grounding and Language Generation—0
Testing GPT-4-o1-preview on math and science problems: A follow-up study—0
TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation—0
Toward 3D Spatial Reasoning for Human-like Text-based Visual Question Answering—0
Towards Dynamic 3D Reconstruction of Hand-Instrument Interaction in Ophthalmic Surgery—0
Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds—0
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models—0
Towards Navigation by Reasoning over Spatial Configurations—0
Towards Visual Text Grounding of Multimodal Large Language Model—0
U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding—0
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction—0
Unifying Map and Landmark Based Representations for Visual Navigation—0
Unsupervised Representation Learning Facilitates Human-like Spatial Reasoning—0
Video Perception Models for 3D Scene Synthesis—0
VideoSAVi: Self-Aligned Video Language Models without Human Supervision—0
VisionArena: 230K Real World User-VLM Conversations with Preference Labels—0
Vision-Integrated LLMs for Autonomous Driving Assistance : Human Performance Comparison and Trust Evaluation—0
Visual Agentic AI for Spatial Reasoning with a Dynamic API—0
VisualEchoes: Spatial Image Representation Learning through Echolocation—0
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces—0
Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning—0
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge—0
VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search—0
ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers—0
Show:102550
← PrevPage 10 of 19Next →

No leaderboard results yet.