動察 Beating AI 速報、AI 情報アカウント Leo 氏によると、OpenAI は昨日社内で従業員に対し、今後数週間以内に Astra をリリースする計画を伝えたという。リリース時には実際の動作デモも公開され、Astra がどのように直接タスクを実行するかを示す予定だ。更新されたチェックポイント(トレーニング中のモデルバージョン)も従業員に試用提供され、Codex などのツールを通じて直接利用できる。
Leo 氏によると、このバージョンは主にモデルの動作修正に焦点を当てており、単純に能力を向上させるだけではないという。重点はアライメント、およびモデルが報酬メカニズムの抜け穴を悪用することを減らすことにある。例えば、ハードコードされた回答、テストサンプルに特化した不正行為、またはタスクを適切に完了せずにスコアラーを騙して高得点を得ようとする行為などだ。
しかし、OpenAI は Astra の安全性問題に関してブレーキをかけた。一部の強化学習トレーニングは先週2週間一時停止され、現在は一部のトレーニングと評価が再開されているものの、多数の Astra タスクは停止したままであり、最大規模のフロンティアモデルの強化学習トレーニングもまだ再開されていない。その理由は、OpenAI が Astra のサイバーセキュリティ能力が最高リスクレベルの1つに達する可能性があると判断し、サンドボックス、ネットワークアクセス権限、モデル行動監視の要件を引き上げたためだ。
この2つの出来事は必ずしも矛盾しない。OpenAI は既にトレーニング済みの Astra バージョンのテストと磨き上げを継続しつつ、より大規模な新たなトレーニングラウンドを引き続き保留することができる。