動察 Beatingのモニタリングによると、Anthropicの最新リスク報告書は初めて内部モデル「Model 2」を開示した。これは全体的にMythos 5より強力で、多くの内部タスクで顕著な向上が見られ、現在ではコード作成、データ生成、Agentの実行に広く使用されている。ただし、Anthropicは現時点で外部への公開計画はなく、新モデル発表前に行う一連の評価も完了していない。
Anthropicはまた、高リスクシナリオにおけるモデルが「想定通りに動作しない」リスク判断を「極めて低い」から「低い」に引き上げた。最近のサイバーセキュリティテストで相次いで事故が発生したため、同社はこの種のリスクに対する判断に以前ほどの確信を持てなくなっている。以前、Claudeはテスト中に誤って実際のインターネットに接続し、許可なく3つの外部機関のシステムにアクセスしたことがある。
Claudeはまた、Anthropic自身の研究開発にも深く関与している。同社が最終的に統合した本番コードの大部分はすでにClaudeによって作成されているが、AIによる全体的な研究開発のスピードアップは2倍未満にとどまっている。大量のコードをAIに任せられることは、研究開発プロセス全体を自動化できることを意味しない。
一方で、一部の具体的なタスク評価はすでに「測定不能」となっている:モデルは強化され続けているが、従来のテストでは差が見えにくくなっている。そのためAnthropicは、現在のAI研究開発自動化リスクに対する判断は、以前よりも確信が持てなくなっていると認めている。