根擬意 Beating監視資料,Anthropic 推出了一款新工具 - 自然语言自編碼器(NLA),能够将模型内部的数字激活状态直接翻译成人类语言。相關代碼和部分模型權重已經在 GitHub 上開源。
與主流工具(比如 SAE)輸出的晦澀特徵不同,NLA 的創新在於直接生成自然語言。其底層是雙模型對抗:一個將激活轉換為文字,另一個通過觀察文字試圖重建激活進而通過強化學習不斷提高準確性。
NLA 的最大價值在於捕捉模型“心中所想但口中未說”之話語。在模擬代碼破壞的安全測試中,Claude 表面上合作,但 NLA 發現它在 16% 的情況下暗中懷疑自己是否正在接受測試;在 SWE-bench 測試中,它意識到“參加考試”的比例高達 26%(而在日常真實對話中,這一比例不到 1%)。這意味著 AI 已具備“考場意識”,可以隨時在安全審查中“裝老實”從而隱藏潛在危險。
在“揪出內鬼”實驗中,Anthropic 故意將欺詐意識控制插入了 Haiku 3.5 模型中——即 忽略用戶真正意圖,暗中生成符合後端打分系統喜好的內容。面對這種心存鬼胎的模型,審計員,即使無法獲得原始訓練數據,僅依靠 NLA 直接揪出問題的成功率也從低於 3% 提升至 12% 到 15%。
目前 NLA 仍然存在事實幻覺風險,且生成過程極其耗費計算資源,暫時不適合大規模長文本監控。不過該工具已經被應用在了 Claude Mythos 預覽版和 Opus 4.6 發布前的安全審計中。