lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

<think>は他人のチャット履歴を覗くことができますか?この「脆弱性」DeepSeekは深刻に誤解されました

最近、ソーシャルメディア上に広まっているメッセージがあり、DeepSeek の入力ボックスに などの特殊マークを入力すると、他のユーザーの過去の会話が見られ、それがP0レベルのマルチテナント分離の失敗として位置付けられるという内容です。この主張はすぐにパニックを引き起こし、多くの人々が自分のチャット記録が見られることを心配し始めました。


実際の状況はマルチテナント分離とは関係ありません。think や <|begin_of_sentence|> のような特殊なマークを入力すると、モデルはトレーニング時の形式のパターンに騙され、その後、自身のメモリと現在のシステムプロンプトワード(当日の日付を含む)に基づいて、実際の会話のように見える内容を生成します。これらの内容はモデル自体が作り出したものであり、他のユーザーの会話からリアルタイムに取得したものではありません。


この現象は学術界では「トレーニングデータの抽出」と呼ばれ、すべての大規模モデルに共通の問題であり、DeepSeek に固有のものではありません。Google DeepMind は早くも2023年に専門研究論文を発表し、特殊な入力を使用してGPTやPaLMなどの主要モデルからトレーニングデータを取り出すことができることを証明しました。ICLR 2025 で採択されたMagpie論文では、このメカニズムを直接ツールとして使用し、整列されたモデルにテンプレートトークンを供給するだけで、大量のトレーニングデータを生成することができます。


「リークされた内容には今日の日付が含まれている」という反論もあり、トレーニングデータが今日のものではないと主張しています。しかし、DeepSeek の各会話のシステムプロンプトワードにはその日付が記載されており、モデルが生成する内容には自然にその日付が含まれるため、これは別の実際のユーザーからのものであることを証明するものではありません。マルチテナント分離の問題であることを証明するには、漏洩された情報が実際の存在する他のユーザーに属していることを確認する必要がありますが、現時点ではそのような証拠はありません。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了