Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion

· Source: Computer Vision and Pattern Recognition · Field: Technology & Digital — Artificial Intelligence & Machine Learning, Computer Vision & Pattern Recognition · Depth: Expert, quick

Summary

A multimodal framework for Ambivalence/Hesitancy (A/H) recognition in video was developed for the ABAW11 challenge at ECCV 2026. This approach integrates textual, acoustic, and visual modalities extracted from the BAH dataset using pretrained encoders: F2LLM-v2-0.6B for transcripts (1024-d), WavLM-Large for audio (1024-d), and VideoMAE V2 for facial video (768-d). Initial unimodal baselines, optimized with Optuna, showed text features alone achieved a Macro F1 of 0.6659 on the test set, substantially surpassing the zero-shot Video-LLaVA baseline's 0.2827. The proposed multimodal fusion architecture, which employs bidirectional cross-attention across all three modalities and a Gated Multimodal Unit (GMU), was also optimized via a 50-trial Optuna search. This model achieved a Macro F1 of 0.7394 on the validation set, demonstrating an 11.0% relative improvement over the best unimodal baseline and confirming the value of explicit cross-modal interaction.

Key takeaway

For AI Scientists developing robust human behavior recognition systems, this research indicates that integrating textual, acoustic, and visual modalities significantly enhances performance. You should prioritize architectures that facilitate explicit cross-modal interaction, such as bidirectional cross-attention and Gated Multimodal Units, to capture complementary cues. Leveraging tools like Optuna for hyperparameter and architectural optimization is also vital for achieving superior results, as unimodal approaches often fall short.

Key insights

Multimodal fusion with cross-attention and gated units significantly improves ambivalence/hesitancy recognition over unimodal approaches.

Principles

Method

Extract textual, acoustic, and visual features using pretrained encoders, then fuse them with bidirectional cross-attention and a Gated Multimodal Unit (GMU), optimizing architecture and hyperparameters via Optuna.

In practice

Topics

Code references

Best for: Research Scientist, AI Scientist, Machine Learning Engineer

Related on AIssential

Open in AIssential →

Editorial summary, takeaway, and curation by AIssential. Original article published by Computer Vision and Pattern Recognition.