GPT-Red: Unlocking Self-Improvement for Robustness

· Source: OpenAI News · Field: Technology & Digital — Artificial Intelligence & Machine Learning, Cybersecurity & Data Privacy, Robotics & Autonomous Systems · Depth: Advanced, medium

Summary

OpenAI has developed GPT-Red, an automated red-teaming model designed to identify and fix vulnerabilities in large language models, particularly prompt injection attacks. This model was trained using self-play reinforcement learning at a compute scale comparable to OpenAI's largest post-training runs. GPT-Red proved highly effective, achieving an 84% attack success rate on novel scenarios against GPT-5.1, significantly outperforming human red-teamers at 13%. By incorporating GPT-Red into the training process, OpenAI's GPT-5.6 Sol model achieved 6x fewer failures on its hardest direct prompt injection benchmark compared to previous models, and reduced "Fake Chain-of-Thought" attack success rates from 95% on GPT-5.1 to below 10% for GPT-5.6 Sol. The model also demonstrated real-world attack capabilities against an AI-powered vending machine and a Codex CLI agent, while maintaining general frontier capabilities without over-refusal.

Key takeaway

For AI Security Engineers focused on LLM robustness, this research indicates that automated red-teaming is crucial for scaling defenses against prompt injection. You should integrate self-play adversarial training into your model development lifecycle to proactively identify and mitigate vulnerabilities. This approach allows your models to become significantly more resilient, as demonstrated by GPT-5.6 Sol's 6x improvement, without compromising core capabilities. Consider deploying internal-only red-teaming agents to continuously harden your production systems.

Key insights

Automated self-play red-teaming with GPT-Red significantly enhances LLM robustness against prompt injection attacks.

Principles

Method

GPT-Red is trained via self-play reinforcement learning, where it attacks diverse defender LLMs in realistic scenarios, rewarded for eliciting failures, while defenders resist.

In practice

Topics

Best for: Research Scientist, CTO, VP of Engineering/Data, AI Scientist, Machine Learning Engineer, AI Security Engineer

Related on AIssential

Open in AIssential →

Editorial summary, takeaway, and curation by AIssential. Original article published by OpenAI News.