動察 Beating AI 速報、OpenAI の主席科学者 Jakub Pachocki 氏が、なぜ CoT モニタリングがますます信頼性を失っているのかを説明する投稿を行った。CoT モニタリングとは、モデルが書き出す推論プロセスを観察し、その中に隠された目標や不整合な思考が含まれていないかをチェックする手法である。
数日前、外部は Astra の recurrent depth アーキテクチャと CoT モニタリングの機能不全を関連付けた。Pachocki 氏は当時、問題は新しいアーキテクチャによるものではないと反論し、別途理由を説明すると述べていた。5日後、彼は記事の中で3つの理由を挙げた:
第一に、エージェントの推論はますますツール呼び出しや、人間や他の AI との対話の中で行われるようになっており、これらのプロセスは監督を受けなければならない。CoT だけを見ても、完全な推論プロセスを把握することがますます難しくなっている。
第二に、モデルは自身の推論プロセスをますます制御できるようになっている。
第三に、事前学習が強化された後、推論を書き出さなくてもモデルは賢くなり続けることができる。
OpenAI はこれまで CoT モニタリングを重要な安全手段として位置付けてきた。o1-preview が当初完全な思考連鎖を公開しなかったのは、CoT を直接監督することでモデルが本当の意図を隠すことを学ぶのを避けるためだった。現在、OpenAI の評価では、この手法の信頼性が低下していることが示されている。
Pachocki 氏はまた、現在どのラボもアライメントとモニタリングを、長期的に全力でモデルを拡張できるレベルまで解決していないと明言した。共通の安全基準が確立されるまでは、ラボが自主的にペースを落とすことを望み、必要に応じて OpenAI もモデル拡張を停止すると述べている。