lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

AnthropicがClaudeの思考チェーンにロックをかける:文脈を1語変えるだけで無効化、モデル蒸留を徹底的にブロック

動察 Beating AI 速報、Anthropic が Claude の隠れた思考に「コンテキストロック」を追加し始めた。Fable 5.1 で API を通じて生成された暗号化思考は、今後は生成時のシステムプロンプト、ツール、履歴メッセージと一緒にそのまま返送する必要がある。前の内容が少しでも変更されると、API はエラーを報告するか、この思考を直接破棄する。


この変更はモデル蒸留を防ぐためのものだ。これまで研究者は、Claude の暗号化思考はユーザーには読めないが、Anthropic の互換モデルに再送信して読み取らせることができることを発見していた。攻撃者はまず Opus に高品質な推論を生成させ、その暗号化ブロックを防御が弱い Haiku に渡し、Opus の完全な思考を読み出させるように誘導できる。これは大規模モデルの回答だけでなく、下書き用紙の解答プロセスまで丸ごと持ち出すようなものだ。


Anthropic は 6 月に Fable 5 をリリースした際にすでに一度対策を講じ、暗号化思考をモデルにバインドし始め、Haiku のような小規模モデルに復号を手伝わせることをできなくした。Fable 5.1 では今回さらに「会話バインド」を追加:モデルを変更しなくても、前のプロンプト、ツール、チャット履歴を変更すれば、古い思考も同様に無効になる。


このロックはまだ全面的には開放されていない。8 月 31 日以降に新規開設された API アカウントが Fable 5.1 を呼び出す際にのみ強制適用され、既存アカウントは当面影響を受けない。Claude.ai、Claude Code、Cowork、その他の Claude モデルも対象外だ。Anthropic は、今後リリースされる新モデルではデフォルトで全ユーザーにこのルールを適用すると述べている。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了