Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

· Source: Computation and Language · Field: Technology & Digital — Artificial Intelligence & Machine Learning · Depth: Expert, quick

Summary

The Fusion Embedding family introduces a unified embedding space for text, images, video, and audio, allowing a single index to serve diverse user queries. This system integrates audio into a frozen vision-language embedding base, which already handles text, images, and video, without updating the base parameters. Fusion-embedding-1 employs a 16.4M-parameter connector between a frozen audio tower and the base. Fusion-embedding-2 enhances this with 44.2M-parameter modality-gated deep adapters that do not execute on text, image, or video inputs, ensuring bit-for-bit output consistency with the original base. Critically, aligning audio to text alone enables emergent audio-image retrieval without requiring paired audio-visual training data. The authors also detail design space exploration, including controlled negative results showing that LLM-rewritten captions, alternative audio towers, or wider connectors reduce retrieval performance. Both generations train in hours on a single GPU, with weights, code, and evaluation harness openly released.

Key takeaway

For Machine Learning Engineers developing multimodal retrieval systems, Fusion Embedding offers a compelling strategy to integrate audio efficiently. You can extend existing vision-language models to include audio by training minimal connector parameters, avoiding costly full model retraining. This approach enables emergent audio-image retrieval without needing paired audio-visual data, significantly reducing data acquisition burdens. Consider adopting this method to rapidly expand your system's modality support and enhance user query capabilities.

Key insights

Aligning audio to a frozen vision-language base via text enables emergent cross-modal retrieval without paired audio-visual data.

Principles

Method

Fusion Embedding connects a frozen audio tower to a frozen vision-language embedding base using a small connector (16.4M params) or modality-gated deep adapters (44.2M params), aligning audio to text.

In practice

Topics

Best for: Research Scientist, AI Architect, AI Product Manager, AI Scientist, Machine Learning Engineer, AI Engineer

Related on AIssential

Open in AIssential →

Editorial summary, takeaway, and curation by AIssential. Original article published by Computation and Language.