動察 Beatingのモニタリングによると、DeepSeekは北京大学と共同で投機的サンプリング高速化フレームワーク「DSpark」の技術報告書を発表し、フルスタックコードベース「DeepSpec」をオープンソース化しました。現在、DSparkはDeepSeek-V4のオンライン業務に導入されています。出力の無損失を保証しつつ、DSparkはFlash版のシングルユーザー生成速度を60%から85%向上させ、Pro版の速度を57%から78%向上させました。DSparkは従来のシングルトークン多分岐予測(MTP-1)ベースラインを上回り、厳格なレイテンシ制約下でシステム全体のスループットを大幅に引き上げました。
これまで、マルチトークン投機的サンプリングはオンライン本番環境での実装が困難でした。自己回帰型ドラフトモデルの生成が遅すぎる一方、並列ドラフトモデルは各位置が独立して予測するため、長いシーケンスの後半部分の受容率が極めて低くなります。高並列環境でマルチトークンドラフトを盲目的に検証すると、大規模モデルは拒否される誤字の検証に大量の計算リソースを浪費し、システム全体のスループットが深刻に低下するため、業界ではオンラインでシングルトークン予測(MTP-1)に限定されていました。
DSparkは高並列環境下でのスループット低下のボトルネックを克服しました。まず、DFlash並列バックボーンネットワークを使用して隠れ状態を生成し、その後、極めて軽量なマルコフヘッドを追加します。マルコフヘッドはテーブル参照と1回の行列乗算により、非常に低コストで隣接単語間の関連性を直列的に注入します。同時に、システムは信頼度予測ヘッドと事後較正アルゴリズムを統合しています。本番環境でのゼロオーバーヘッドスケジューリングと将来の情報漏洩防止を完全に両立させるため、スケジューラは非同期メカニズムを採用し、2ステップ前の履歴予測を利用して候補語のトリミング長を動的に決定し、大規模モデルが高負荷時にリスクの高い末尾の誤字を検証するのを完全に防止します。
DSparkに加え、DeepSeekが今回オープンソース化したDeepSpecコードベースは、Qwen3やGemmaなどのオープンソース大規模モデルをネイティブでサポートしています。DeepSpecは、プロンプトのダウンロード、大規模モデルキャッシュの再構築、ドラフトモデルのトレーニングからベンチマーク評価までの完全なPythonツールチェーンを提供します。開発者はオープンソーススクリプトを直接利用して、ローカルで異なるオープンソース大規模モデル向けに専用の高速化モジュールをカスタマイズし、デプロイすることができます。