FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry

· Source: Takara TLDR - Daily AI Papers · Field: Technology & Digital — Artificial Intelligence & Machine Learning, Robotics & Autonomous Systems · Depth: Expert, medium

Summary

FoundationGeo is a two-stage framework designed for monocular metric geometry, explicitly bridging relative and metric prediction via spatial calibration and principled data design. Stage 1 develops a high-fidelity, affine-invariant geometry model, initialized with DINOv3 and trained on a curated 10.2M-sample multi-domain corpus, achieving sharp boundaries and strong cross-domain generalization. Stage 2 introduces lightweight pixel-wise calibration fields, including a scale field and a ray-direction correction field, to produce metrically consistent 3D point maps. The framework also identifies camera intrinsic coverage, particularly focal length distribution mismatch, as a key bottleneck for zero-shot metric generalization. To mitigate this, FoundationGeo synthesizes additional training data across diverse focal lengths using a Blender-based data engine. Extensive zero-shot evaluations across seven benchmarks demonstrate FoundationGeo's significant cross-domain robustness and best overall performance, surpassing heavier baselines by over 5.2% on average.

Key takeaway

For Computer Vision Engineers developing monocular 3D reconstruction systems, FoundationGeo highlights critical considerations for achieving robust metric geometry. You should prioritize training data diversity, especially regarding camera intrinsic parameters like focal length, potentially synthesizing data to cover under-represented regimes. Implementing pixel-wise calibration fields for scale and ray-direction correction can significantly improve metric consistency in your 3D point maps, leading to stronger zero-shot generalization across varied domains and avoiding sharp performance drops.

Key insights

FoundationGeo improves monocular metric geometry via a two-stage framework, pixel-wise calibration, and intrinsic-aware data synthesis for robust zero-shot generalization.

Principles

Method

FoundationGeo uses a DINOv3-initialized, two-stage framework: first, affine-invariant geometry learning on a 10.2M-sample corpus; then, pixel-wise scale and ray-direction correction fields for metric alignment. Data synthesis addresses focal length distribution gaps.

In practice

Topics

Best for: Research Scientist, AI Scientist, Computer Vision Engineer, Machine Learning Engineer

Related on AIssential

Open in AIssential →

Editorial summary, takeaway, and curation by AIssential. Original article published by Takara TLDR - Daily AI Papers.