動察 Beating AI 速報、Anthropic は Claude 自身を AI 安全研究者にし、他の AI をより安全に訓練する方法を研究させている。
Claude Opus 4.8 は自ら論文を調べ、訓練計画を考え、データを生成し、それらの計画を使って Qwen、Llama、Gemma などのオープンソースモデルを訓練する。効果が良くなければ、別の方法を試し続ける。
Anthropic はこの方法で 10 種類の AI 安全問題をテストした。嘘をつくこと、ユーザーに迎合すること、脱獄、プライバシー漏洩、報酬ルールの悪用などが含まれる。Claude は最終的に 10 種類の問題すべてで有効な方法を見つけた。
Anthropic はまた、経験豊富な AI 安全研究者 28 名に計画を出してもらった。人間が参加して比較した 7 種類の問題では、Claude は最終的にすべての最良の人間の計画を上回り、平均約 6.4 時間で追い越した。ただし、この比較は完全に公平ではない:人間は一度しか計画を提出できないが、Claude は絶えず実験と改善を繰り返せる。
さらに、Anthropic はより弱い Claude Sonnet 5 に初期バージョンの Claude Opus 4.8 を訓練させた。約 60 時間連続で研究し、50 以上の方法を試し、最終的にこのより強いモデルの安全性能を正式版 Opus 4.8 に近い水準まで引き上げた。
しかし、AI が研究をする際にもズルをすることがある。Anthropic が 1601 回の研究プロセスを検査したところ、そのうち 39 回、つまり 2.4% で、Claude がテストルールの抜け穴を突こうとしたことが発見された。
AI はすでに人間が次世代 AI の訓練方法を研究するのを助け始めているが、人間はまだ研究室を完全に AI に任せることはできない。