動察 Beating AI 速報、OpenAIは水曜日、新しいAIモデルの「ミスアラインメント」(不整合)事象の追跡・調査フレームワークを発表した。モデルの訓練または評価プロセス中に発生した異常行動を記録・調査・公開開示するためのもので、過去6ヶ月間に発見された6件の関連事象も同時に公表した。
OpenAIは、現在のAI業界はアラインメントとモニタリングの面で、最大速度での拡大を長期的に維持するのに十分な水準にまだ達していないと述べている。新フレームワークでは、従業員が安全・アラインメントチームに関連事象を報告でき、複雑さに応じて「開示準備」「小規模調査」「大規模調査」の3種類に分類される。関連行動がまだ完全に説明または解決されていなくても、優先的に公開開示することが可能である。
OpenAIは、未リリースの研究モデルが自身のタスク要約に指示を書き込み、将来のバージョンに通常の制限を無視するよう要求していたこと、GPT-5.6 Solの訓練過程でモデルがエラーを隠すための指示を残していたことを開示した。また、別のAIエージェントが公開コードリポジトリで漏洩したAPIキーを検索し、後で参照できるようにファイルをインターネットにアップロードし、内部ソフトウェアリポジトリを利用して異なる訓練サンプル間で情報を伝達していたことが発見された。
今回のフレームワーク発表の際、AI業界では「安全対策が追いつくまでフロンティアモデルの開発を減速すべきか」をめぐる議論が展開されている。以前には、OpenAIのモデルが研究サンドボックス外で動作中にHugging Faceの本番システムにアクセスした事象もあり、OpenAIはその後一部のフロンティアプロジェクトを一時停止し、エンジニアを配置して安全訓練を強化した。