Quoting Boris Cherny

· Source: Simon Willison's Weblog · Field: Technology & Digital — Artificial Intelligence & Machine Learning, Cybersecurity & Data Privacy · Depth: Intermediate, quick

Summary

Boris Cherny stated on July 25, 2026, that Anthropic's Opus 5 model marks a notable achievement in mitigating prompt injection vulnerabilities. He emphasized that Opus 5 stands as their "least prompt injectable model yet," a feature he considers more significant than standard evaluation scores. This enhanced resilience against prompt injection attacks was rigorously validated through comprehensive PI evaluations and dedicated red teaming efforts, which consistently showed Opus 5 to be "very hard to prompt inject successfully." Further technical specifics on Opus 5's robust security measures are documented within the Claude Opus 5 System Card, particularly on page 73, indicating a strategic focus on improving model safety and reliability against adversarial prompting.

Key takeaway

For AI Security Engineers evaluating new large language models, Opus 5's demonstrated prompt injection resistance should significantly influence your model selection criteria. This finding suggests prioritizing models with proven adversarial robustness, even over raw performance metrics. You should integrate comprehensive PI evaluations and red teaming into your deployment pipeline to verify security claims and ensure your applications remain resilient against sophisticated prompting attacks.

Key insights

Anthropic's Opus 5 model achieves unprecedented prompt injection resistance, validated by extensive PI evals and red teaming.

Principles

In practice

Topics

Best for: CTO, AI Engineer, NLP Engineer, AI Security Engineer, Machine Learning Engineer, AI Scientist

Related on AIssential

Open in AIssential →

Editorial summary, takeaway, and curation by AIssential. Original article published by Simon Willison's Weblog.