動察 Beating AI 速報、Claude Code の責任者 Boris Cherny 氏が投稿し、GPT-6 Astra のプロンプトインジェクション対策は Gemini Flash、Claude Opus 4.8 と「ほぼ同等」であり、さらに自社の Claude モデルは約2ヶ月前に「実践的にこの問題を解決した」と述べた。プロンプトインジェクションとは、悪意のある命令をウェブページやドキュメントなどのコンテンツに隠し、Agent にデータ漏洩や危険な操作を実行させる手法である。
Boris 氏はまた、公開評価や他ラボの名指しは、より安全なモデルを訓練するよう促す良い方法であり、「他のラボが安全性をより重視するまで、我々はこれを続ける」と述べた。
この投稿はすぐに X の Community Note によって反論された。Gray Swan の独立評価によると、テストされたモデルのいずれもプロンプトインジェクションに完全に免疫があるわけではなく、Claude にも攻撃成功事例が存在する。別のセキュリティ研究者は、特製ウェブページを使用して Claude Code Opus 5 Auto Mode を攻撃し、小規模テストで 60%–80% の成功率を達成した。
OpenAI のコア製品責任者 Thibault Sottiaux 氏はその後、Boris 氏の文調をそのまま逆に書き換えた。彼は、Claude Code の新たなバックグラウンドコンピュータ操作がついに Codex に追いついたことを嬉しく思うと述べ、「しかも我々の今年5月のバージョンに」と付け加えた。
Boris 氏は後に、元の投稿が「意図したよりも皮肉に受け取られた」と認め、Astra の進歩を真剣に評価していたことを強調した。また、いわゆるプロンプトインジェクションが「解決された」とは、Claude モデル、インジェクション検出メカニズム、Auto Mode を組み合わせた製品効果を指しており、モデル自体が免疫を持ったわけではないと明確にした。