動察 Beating AI 速報、Anthropic が Claude の隠れた思考に「コンテキストロック」を追加し始めた。Fable 5.1 で API を通じて生成された暗号化思考は、今後は生成時のシステムプロンプト、ツール、履歴メッセージと一緒にそのまま返送する必要がある。前の内容が少しでも変更されると、API はエラーを報告するか、この思考を直接破棄する。
この変更はモデル蒸留を防ぐためのものだ。これまで研究者は、Claude の暗号化思考はユーザーには読めないが、Anthropic の互換モデルに再送信して読み取らせることができることを発見していた。攻撃者はまず Opus に高品質な推論を生成させ、その暗号化ブロックを防御が弱い Haiku に渡し、Opus の完全な思考を読み出させるように誘導できる。これは大規模モデルの回答だけでなく、下書き用紙の解答プロセスまで丸ごと持ち出すようなものだ。
Anthropic は 6 月に Fable 5 をリリースした際にすでに一度対策を講じ、暗号化思考をモデルにバインドし始め、Haiku のような小規模モデルに復号を手伝わせることをできなくした。Fable 5.1 では今回さらに「会話バインド」を追加:モデルを変更しなくても、前のプロンプト、ツール、チャット履歴を変更すれば、古い思考も同様に無効になる。
このロックはまだ全面的には開放されていない。8 月 31 日以降に新規開設された API アカウントが Fable 5.1 を呼び出す際にのみ強制適用され、既存アカウントは当面影響を受けない。Claude.ai、Claude Code、Cowork、その他の Claude モデルも対象外だ。Anthropic は、今後リリースされる新モデルではデフォルトで全ユーザーにこのルールを適用すると述べている。