今日、DeepSeek は V4 シリーズのプレビューバージョンをオープンソース化し、重みは Hugging Face と ModelScope に同期させ、MIT ライセンスを採用しました。このシリーズには、2 つの MoE モデルが含まれています:V4-Pro(総パラメーター 1.6T、各トークンのアクティブ化 49B/490 億)および V4-Flash(総パラメーター 284B/2840 億、アクティブ化 13B/130 億)、どちらも 1M トークンのコンテキストをサポートしています。
アーキテクチャのレベルで 3 つの主要なアップデートが行われました:
· 混合注意機構 には、圧縮スパース注意力 CSA およびヘビー圧縮注意力 HCA が含まれており、長いコンテキストのオーバーヘッドを大幅に削減しています。1M コンテキストで、V4-Pro の単一トークン推論 FLOPs は V3.2 の 27% であり、KV キャッシュ使用量は V3.2 の 10% です。
· マニフォールド制約ハイパーコネクション(mHC) は、従来の残差接続を置き換え、クロスレイヤーシグナル伝播の安定性を向上させています。
· トレーニングには Muon オプティマイザーを使用して収束を加速しました。事前トレーニングデータの総量は 32T トークンを超えています。
ファインチューニングは 2 段階に分かれています:まず SFT および GRPO を使用して各エキスパート分野を個別にトレーニングし、その後オンライン蒸留によって1つのモデルに統合されます。
V4-Pro の最高推論モードは V4-Pro-Max と呼ばれています。公式の技術レポートでは、このモデルを Opus 4.6 Max、GPT-5.4 xHigh、Gemini 3.1 Pro High 、およびオープンソースの Kimi K2.6、GLM-5.1 と比較しています(最新の Opus 4.7 および GPT-5.5 は含まれていません。最終的な差異は第三者の検証を待ちます)。
エンコーディング面では、V4-Pro-Max は Codeforces で 3206 ポイントを獲得し、GPT-5.4 の 3168 および Gemini 3.1 Pro の 3052 を上回り、このベンチマークを更新しました。LiveCodeBench スコアは 93.5 で、同様にトップクラスです。SWE Verified スコアは 80.6 で、Opus 4.6 の 80.8 に次ぐものの、わずか 0.2 ポイント差です。
長い文脈に関して、両方の 1M ベンチマークは第2位にランクインしています:CorpusQA 1M のスコアは 62.0(Opus 4.6 は 71.7)、MRCR 1M のスコアは 83.5(Opus 4.6 は 92.9)。
エージェントタスクに関して、MCPAtlas Public のスコアは 73.6 で、Opus 4.6 の 73.8 にわずかに劣ります;Terminal-Bench 2.0 のスコアは 67.9 で、GPT-5.4 の 75.1 や Gemini 3.1 Pro の 68.5 よりも低くなっています。
知識と推論に関して、明らかな差がまだ存在しています:GPQA Diamond 90.1(Gemini 94.3)、SimpleQA-Verified 57.9(Gemini 75.6)、HLE 37.7(Gemini 44.4)。
オープンソースモデルである V4-Pro-Max は、多くのエンコーディングおよび長い文脈のベンチマークで、いくつかのクローズドソースのフラッグシップモデルに対して初めて追いついたり、それを上回ったりしていますが、知識集約的な評価ではまだ Gemini 3.1 Pro に劣っています。
DeepSeek は内部の dogfooding データをめったに公開しません。チームは、約200個の実際の開発タスクをカバーする50人以上のエンジニアからデータを収集し、機能開発、バグ修正、リファクタリング、診断を含み、PyTorch、CUDA、Rust、C++などの技術スタックが含まれており、厳密な選別の結果、30個のタスクが評価セットとして選ばれました。
V4-Pro-Max の合格率は67%で、Sonnet 4.5 の47%よりも有意に高く、Opus 4.5 の70%に近いですが、Opus 4.5 Thinking の73%やOpus 4.6 Thinking の80%を下回っています;Haiku 4.5 の合格率はわずか13%です。N=85の内部調査によると、すべての回答者が日常業務でV4-Proを使用していることが示され、52%がV4-Proをデフォルトのメインエンコーディングモデルと考えており、39%が肯定的な見解を持っており、9%未満が否定的と回答しています。フィードバックによると、主な問題は小さなエラー、曖昧なプロンプトの誤解、および過剰な思考の偶発的な発生です。
形式数学の推論において、Putnam(プトナム競技)は北米で最も高い水準の学部数学競技です。実用シナリオ(Practical Regime)では、V4-Flash-Max は Putnam-200 Pass@8 ベンチマークで 81.00 点を獲得し、オープンソースツール LeanExplore と制限付きサンプリングを使用しました。対照として、Seed-2.0-Prover は 35.50、Gemini 3 Pro および Seed-1.5-Prover はそれぞれ 26.50 でした。
フロンティアシナリオ(Frontier Regime)では、V4 はハイブリッド形式の非形式推論アプローチを採用し、まず非形式の推論で候補の自然言語解を生成し、自己検証フィルタリング後、フォーマルエージェントが Lean で厳密な証明を行いました。V4 は Putnam-2025 で 120/120 の満点を獲得し、Axiom と並んで首位を獲得し、Seed-1.5-Prover の 110/120 や Aristotle の 100/120 よりも高得点でした。フロンティアシナリオでは、大規模な計算拡張が使用され、実用シナリオの結果は一般展開能力をよりよく反映しています。
DeepSeek V4 API は、V4-Pro および V4-Flash と同期してリリースされました。公式公式が価格設定とコンピューティングリソースの計画を発表しました:V4-Flash は V3.2(deepseek-chat)のバージョンを直接置き換え、価格が引き下げられました−−キャッシュヒットの入力は変わらず(0.2 ドル/百万トークン)、キャッシュミスの入力は 2 ドルから 1 ドルに引き下げられ(50% 削減)、出力は 3 ドルから 2 ドルに引き下げられました(33% 削減)。コンテキストは 128K から 1M に拡張され、より安価な価格で 8 倍のコンテキストを取得できるようになりました。古いモデル名の deepseek-chat と deepseek-reasoner は、2026 年 7 月 24 日に廃止され、現在それぞれ V4-Flash のノンシンキングモードとシンキングモードを指します。
V4-Pro は新しいハイエンドモデルです:キャッシュヒットの入力は 1 ドル、ミスは 12 ドル、出力は 24 ドル/百万トークンであり、出力価格は V3.2 の 8 倍です。DeepSeek は価格表の注釈で説明しており、ハイエンドの計算リソースに制限があるため、現在の Pro のサービススループットは非常に限られていますが、下半期には 950 の超ノードが一括上場されることが予想され、Pro の価格は大幅に引き下げられるでしょう。両モデルはノンシンキングモードとシンキングモードの両方をサポートしており、シンキングモードでは reasoning_effort パラメータを high/max という 2 つの強度で設定できます。
DeepSeek は、声明で「これから、1M コンテキストが DeepSeek のすべての公式サービスの標準仕様となります。」と述べました。
DeepSeek V4 テクニカルレポートは、Agent 後のトレーニングおよび大規模評価をサポートする基幹インフラストラクチャである本番向け弾力性コンピューティングサンドボックス DSec(DeepSeek Elastic Compute)を初めて公開しました。
現在の大規模モデル強化学習には、非常に大規模なコードの試行錯誤環境が必要です。レポートによると、実際の本番環境では、単一の DSec クラスターが数十万の同時サンドボックスをスケジュールすることができます。システムは Rust で記述されており、自家製の 3FS 分散ファイルシステムに接続し、階層的なオンデマンドローディングにより大規模なサンドボックスの冷起動パフォーマンスボトルネックを克服しました。
開発者のエクスペリエンスでは、DSec は Python SDK を使用して関数呼び出し、コンテナ、マイクロ仮想マシン、および完全な仮想マシンの 4 つの実行ベースを統一し、切り替える際には 1 つのパラメーターのみを変更すればよいようにしています。算力クラスターでよく見られるタスクのプリエンプション問題に対処するために、DSec はグローバルトレースログを導入しました:タスクが再開されると、システムはキャッシュされたコマンドの実行結果を直接「高速進行」し、高速なブレークポイント継続トレーニングを実現し、再実行による非冪等エラーを回避します。
DeepSeek V4 リリース前に、コミュニティーでは、V4 のオンライン日が予想より遅れたことは、モデルが NVIDIA から Huawei Ascend プラットフォームに移行する際に適合性の問題に遭遇したためだとする憶測が広く流布していました。V4 テクニカルレポートはこの噂に直接的には触れませんでしたが、公開された性能データはこの憶測とは明らかに矛盾しています。
レポートによると、V4 のファイングレインド EP スキームは、NVIDIA GPU と Huawei Ascend NPU の両プラットフォームで展開検証が完了しており、通常の推論負荷が1.50倍から1.73倍に加速され、RL ロールアウトと高速エージェントサービスなどの遅延に敏感なシーンでは最大1.96倍の加速が達成されました。チームは CUDA バージョンのカーネル MegaMoE を DeepGEMM の一部としてオープンソース化しました。言い換えれば、V4 は 2 種類のハードウェア上でほぼ理論上限の効率を発揮し、クロスプラットフォームの適合性によるパフォーマンスの低下はありませんでした。
BlockBeats の公式コミュニティに参加しよう:
Telegram 公式チャンネル:https://t.me/theblockbeats
Telegram 交流グループ:https://t.me/BlockBeats_App
Twitter 公式アカウント:https://twitter.com/BlockBeatsAsia