C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes

· Source: Computer Vision and Pattern Recognition · Field: Technology & Digital — Artificial Intelligence & Machine Learning, Robotics & Autonomous Systems · Depth: Expert, quick

Summary

C-GAP (Caption-Guided Augmentation and Prompting) is a new detector-agnostic, annotation-free framework designed to improve vision-language models' detection of rare object classes in safety-critical perception systems. This framework addresses class imbalance by iteratively refining natural language prompts fed to frozen open-vocabulary detectors, rather than retraining models or collecting new annotations. C-GAP operates in two phases: first, it establishes a composite caption baseline by combining per-image scene descriptions with class-quantity context, which significantly outperforms single-context prompts. Second, an LLM iteratively refines individual image captions, triaging trials based on minority-class AP@0.5 against a dynamic threshold, with refinement stopping upon sufficient gain. Experiments demonstrate C-GAP improves minority-class average precision by up to 53% over baselines, achieving an ~81% relative improvement on COCO's minority-class AP@0.5 (from 17.69 to 32.09) compared to the composite baseline.

Key takeaway

For Machine Learning Engineers developing safety-critical perception systems, C-GAP offers a powerful approach to enhance rare object detection without model retraining. You should consider implementing C-GAP's two-phase prompt refinement, starting with composite captions and leveraging an LLM for iterative optimization. This method significantly improves minority-class average precision, allowing you to boost performance on imbalanced datasets efficiently and cost-effectively.

Key insights

Iteratively refining language prompts with an LLM, using composite captions, significantly boosts minority-class detection in frozen vision-language models.

Principles

Method

C-GAP establishes a composite caption baseline, then an LLM iteratively refines image captions. Trials are triaged by minority-class AP@0.5 against a dynamic threshold, terminating early on sufficient gain.

In practice

Topics

Best for: Research Scientist, AI Scientist, Machine Learning Engineer, Computer Vision Engineer

Related on AIssential

Open in AIssential →

Editorial summary, takeaway, and curation by AIssential. Original article published by Computer Vision and Pattern Recognition.