FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry
Summary
FoundationGeo is a two-stage framework designed for monocular metric geometry, explicitly bridging relative and metric prediction via spatial calibration and principled data design. Stage 1 develops a high-fidelity, affine-invariant geometry model, initialized with DINOv3 and trained on a curated 10.2M-sample multi-domain corpus, achieving sharp boundaries and strong cross-domain generalization. Stage 2 introduces lightweight pixel-wise calibration fields, including a scale field and a ray-direction correction field, to produce metrically consistent 3D point maps. The framework also identifies camera intrinsic coverage, particularly focal length distribution mismatch, as a key bottleneck for zero-shot metric generalization. To mitigate this, FoundationGeo synthesizes additional training data across diverse focal lengths using a Blender-based data engine. Extensive zero-shot evaluations across seven benchmarks demonstrate FoundationGeo's significant cross-domain robustness and best overall performance, surpassing heavier baselines by over 5.2% on average.
Key takeaway
For Computer Vision Engineers developing monocular 3D reconstruction systems, FoundationGeo highlights critical considerations for achieving robust metric geometry. You should prioritize training data diversity, especially regarding camera intrinsic parameters like focal length, potentially synthesizing data to cover under-represented regimes. Implementing pixel-wise calibration fields for scale and ray-direction correction can significantly improve metric consistency in your 3D point maps, leading to stronger zero-shot generalization across varied domains and avoiding sharp performance drops.
Key insights
FoundationGeo improves monocular metric geometry via a two-stage framework, pixel-wise calibration, and intrinsic-aware data synthesis for robust zero-shot generalization.
Principles
- Affine-invariant geometry models enhance cross-domain generalization.
- Pixel-wise calibration fields correct spatial metric inconsistencies.
- Focal length distribution impacts zero-shot metric generalization.
Method
FoundationGeo uses a DINOv3-initialized, two-stage framework: first, affine-invariant geometry learning on a 10.2M-sample corpus; then, pixel-wise scale and ray-direction correction fields for metric alignment. Data synthesis addresses focal length distribution gaps.
In practice
- Use DINOv3 for geometry model initialization.
- Synthesize data to cover diverse focal lengths.
- Employ pixel-wise fields for metric consistency.
Topics
- Monocular Metric Geometry
- 3D Reconstruction
- Spatial Calibration
- Zero-Shot Generalization
- DINOv3
- Data Synthesis
- Camera Intrinsics
Best for: Research Scientist, AI Scientist, Computer Vision Engineer, Machine Learning Engineer
Related on AIssential
See Counsel's argued verdicts on the open AI decisions leaders are weighing →
Editorial summary, takeaway, and curation by AIssential. Original article published by Takara TLDR - Daily AI Papers.