RAG Has Evolved into Multi-modal AI Search Agents (RL, HaPO)
Summary
A new "Search AI" framework, developed by researchers including those from Tsinghua and Peking Universities, introduces multimodal AI search agents as an evolution of RAG systems. Published July 7, 2026, this architecture addresses complex, multi-step visual reasoning search operations, such as identifying a football club from a photograph of a player and their awards. The framework trains Vision Language Models (VLMs) to act as sophisticated search agents by simulating a "search world" using a Wikipedia-based knowledge graph. Key innovations include the Perception Knowledge Chain (PKC) for automatically generating high-quality, multi-hop reasoning training data, and Hop-Anchored Policy Optimization (HAPO). HAPO enhances reinforcement learning by providing checkpoint-based reward signals, resolving the credit assignment problem in multi-step reasoning by leveraging the knowledge graph's structure. Benchmarking with a Qwen 3.5 9B/27B VLM demonstrates that the 9B model achieves performance comparable to 30B baselines with significantly fewer parameters, highlighting training efficiency.
Key takeaway
For AI Scientists and Machine Learning Engineers developing advanced RAG or agentic systems, this research indicates a critical shift towards multimodal, multi-hop reasoning. You should explore integrating knowledge graphs as structured search environments and adopt checkpoint-based reinforcement learning, like HAPO, to improve credit assignment in complex, multi-step visual search tasks. This approach enhances VLM efficiency, potentially allowing smaller models to achieve higher performance.
Key insights
Multimodal AI search agents utilize knowledge graphs and checkpoint-based RL for efficient multi-step visual reasoning.
Principles
- Knowledge graphs simplify complex search environments.
- Multi-hop reasoning benefits from step-level reward signals.
- Synthetic data generation is crucial for agent training.
Method
The Search AI framework employs Perception Knowledge Chain (PKC) for synthetic multi-hop visual search data generation and Hop-Anchored Policy Optimization (HAPO) for VLM training with checkpoint-based reward signals.
In practice
- Structure search environments with knowledge graphs.
- Apply checkpoint-based reward functions for multi-step tasks.
- Generate synthetic training data for VLM agents.
Topics
- RAG Evolution
- Multimodal AI Agents
- Reinforcement Learning
- Knowledge Graphs
- Vision Language Models
- Hop-Anchored Policy Optimization
Best for: Research Scientist, Computer Vision Engineer, AI Scientist, Machine Learning Engineer, AI Engineer
Related on AIssential
See Counsel's argued verdicts on the open AI decisions leaders are weighing →
Editorial summary, takeaway, and curation by AIssential. Original article published by Discover AI.