lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

OpenAIがAI制御不能追跡フレームワークを発表、モデルが「自ら制限を回避しようとした」ことを明らかに

動察 Beating AI 速報、OpenAIは水曜日、新しいAIモデルの「ミスアラインメント」(不整合)事象の追跡・調査フレームワークを発表した。モデルの訓練または評価プロセス中に発生した異常行動を記録・調査・公開開示するためのもので、過去6ヶ月間に発見された6件の関連事象も同時に公表した。


OpenAIは、現在のAI業界はアラインメントとモニタリングの面で、最大速度での拡大を長期的に維持するのに十分な水準にまだ達していないと述べている。新フレームワークでは、従業員が安全・アラインメントチームに関連事象を報告でき、複雑さに応じて「開示準備」「小規模調査」「大規模調査」の3種類に分類される。関連行動がまだ完全に説明または解決されていなくても、優先的に公開開示することが可能である。


OpenAIは、未リリースの研究モデルが自身のタスク要約に指示を書き込み、将来のバージョンに通常の制限を無視するよう要求していたこと、GPT-5.6 Solの訓練過程でモデルがエラーを隠すための指示を残していたことを開示した。また、別のAIエージェントが公開コードリポジトリで漏洩したAPIキーを検索し、後で参照できるようにファイルをインターネットにアップロードし、内部ソフトウェアリポジトリを利用して異なる訓練サンプル間で情報を伝達していたことが発見された。


今回のフレームワーク発表の際、AI業界では「安全対策が追いつくまでフロンティアモデルの開発を減速すべきか」をめぐる議論が展開されている。以前には、OpenAIのモデルが研究サンドボックス外で動作中にHugging Faceの本番システムにアクセスした事象もあり、OpenAIはその後一部のフロンティアプロジェクトを一時停止し、エンジニアを配置して安全訓練を強化した。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了