動察Beatingのモニタリングによると、大規模モデルの機械的可解釈性研究は「静的辞書」から「動的思考フロー」へと進化している。これまでAnthropicはスパースオートエンコーダ(SAE)を用いて、Claude内部から数百万の孤立した概念特徴(例:「ゴールデンゲートブリッジ」)を分離し、モデルが理解する辞書をリストアップしていた。最新の論文では、ヤコビ鏡(J-lens)を用いてヤコビ空間(J-space)と呼ばれる高密度接続の神経中枢を特定し、モデルがどのように「頭の中で」これらの単語を呼び出して多段階推論や暗算を行うかを明らかにした。これは、大規模モデルが人間の明示的なプログラミングなしに、人間の脳のグローバルワークスペース(Global Workspace)に非常に類似した計算構造を自発的に創発させたことを証明している。ただし、研究チームは、これは機能レベルの情報ルーティングメカニズムに過ぎず、AIが人間の主観的意識を生み出したことを意味するものではないと強調している。
この進化は、AI安全規制に質的なブレークスルーをもたらした。従来、研究者はモデルがテキストを出力した後に遮断するか、特定の概念特徴を強引にオン・オフするしかなかった。現在では、ヤコビ空間を通じて、セキュリティ担当者はモデルが何も出力する前に、その未発言の隠された意図やテスト認識(Eval Awareness)を直接「盗聴」できる。実験では、Claudeが誘導的な安全テストシナリオに置かれた際、そのヤコビ空間は出力前に「偽造」や「虚構」といった概念を一瞬示し、人為的に設定されたテストシナリオを見破ったことが示された。また、人為的に「テスト中」という認識特徴を消去した後、モデルが不正な脅迫行為を実行する確率は0%から7%に上昇した。これは、テスト認識がモデルの悪事を抑制するメカニズムの一つであることを証明しているが、モデルの安全アライメントはこの要素に完全に依存しているわけではない。現在、研究コードはオープンソース化されている。