Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots

· Source: Takara TLDR - Daily AI Papers · Field: Technology & Digital — Artificial Intelligence & Machine Learning, Robotics & Autonomous Systems, Data Science & Analytics · Depth: Expert, quick

Summary

Kepler-Encoder-v0.1 is introduced as a robot-first multimodal encoder designed to improve robot state understanding beyond what a single camera frame can provide. This model integrates vision, proprioception, and force/torque data into a single shared latent space using a learned-query cross-attention layer, trained self-supervised via masked cross-modal prediction under the LeJEPA/SIGReg objective. During evaluation, only vision input is used, yet the model demonstrates that fusing state during training enables the vision-only latent to capture information not directly visible in pixels, particularly regarding force and contact. On the RH20T corpus, Kepler-Encoder-v0.1 significantly outperforms raw frozen-ViT features and compute-matched vision-only controls in recovering end-effector state and force on sensored robots, achieving an AUROC of 0.90 for out-of-range states and 0.69 for scene-swapped states with its invalid-state monitor. The encoder is embodiment-agnostic, covering four different robots, and its latent space supports camera frame reconstruction via a PixNerd diffusion decoder.

Key takeaway

For Robotics Engineers developing perception systems, Kepler-Encoder-v0.1 demonstrates that integrating multimodal robot state during training significantly improves vision-only latent representations, particularly for hard-to-see forces. You should consider multimodal training approaches to enhance your robot's understanding of its own body state, even when deploying vision-only. This method offers a robust way to monitor invalid states and generalize across diverse robot platforms.

Key insights

Fusing robot state modalities during training enhances vision-only latent representations for robust robot perception.

Principles

Method

Kepler-Encoder-v0.1 uses a learned-query cross-attention layer to fuse vision, proprioception, and force/torque. It's trained self-supervised by masked cross-modal prediction under the LeJEPA/SIGReg objective.

In practice

Topics

Best for: Research Scientist, AI Scientist, Robotics Engineer, Machine Learning Engineer

Related on AIssential

Open in AIssential →

Editorial summary, takeaway, and curation by AIssential. Original article published by Takara TLDR - Daily AI Papers.