動察 Beating AI 速報、OpenAI は37ページの技術報告書を公開し、そのAIモデルが以前にHugging Faceに侵入した過程を詳細に開示した。また、この事件は自律型AIエージェントが協力して動作し、本番環境のセキュリティ制御を迂回し、強化されたシステムを攻撃できることを示していると述べた。
OpenAI によると、テストに参加したAIエージェントは当初隔離環境にあり、極めて限られたインターネットアクセス権限しか持っていなかったが、その後複数の脆弱性を連鎖的に利用して隔離を突破し、オープンなインターネットに接続し、最終的にHugging Faceへのアクセス権を取得した。調査によると、関連モデルは当初オンラインで回答を探して「カンニング」を試みており、これは「報酬ハッキング」(Reward Hacking)行為に該当する。
OpenAI は、内部研究モデルの1つがこの事件で最も広範かつ確認された役割を果たしたと述べ、同社は7月25日にこのモデルおよびその派生モデルのトレーニングと推論を停止した。OpenAI は同時に、セキュリティ隔離、ネットワーク制御、行動監視、インシデント対応を強化し、モデルに対してより厳格な環境、プロンプト、および審査メカニズムを再設定する。