動察 Beating AI 速報、DeepSeek がまたモデルを巨大化しようとしている。CEO の梁文鋒氏が投資家に明かしたところによると、同社は現在 2 兆パラメータのモデルを訓練中で、その後さらに 8 兆パラメータのモデルを開発する計画だという。現行のフラッグシップ V4-Pro はわずか 1.6 兆パラメータに過ぎない。
8 兆とはどのような概念か?現在すでに重みが公開されている超大型モデルの中では、Moonshot AI の Kimi K3 が 2.8 兆パラメータに達し、すでに世界最大のオープンソースモデルとなっている。DeepSeek が計画中の 8 兆モデルは、規模がさらに約 3 倍大きくなる。
ただし、総パラメータが多いからといって、毎回の実行ですべてのパラメータを呼び出すわけではない。Kimi K3 は MoE アーキテクチャであり、2.8 兆の総パラメータのうち各トークンで活性化されるのはわずか 1040 億である。