動察 Beating AI 速報、AIコーディング企業Magicが事前学習研究を発表し、新しいトレーニング手法により約50万ドルのGB200計算リソースだけで、DeepSeek V4 Pro Baseに近い事前学習効果を達成できると述べています。必要な計算量は約1/50です。
Baseは事前学習のみを完了し、強化学習などの後続トレーニングを受けていないベースモデルです。Magicは未見のコード、数学問題、研究論文を用いてモデルをテストし、どちらが後続コンテンツをより正確に予測できるかを比較しました。したがって、ここで比較しているのはベースモデルの事前学習効果であり、チャット、コーディング、またはエージェント能力がすでにDeepSeek V4 Pro製品版に追いついたことを意味するものではありません。
Magicはその後、トレーニング規模を10倍に拡大し、約400万ドルのGB200計算リソースに相当します。このバージョンは同じ自己テストで、テスト対象となったDeepSeek、Kimi、NVIDIAの最新公開Baseモデルを上回りました。Magicは、DeepSeek V4 Proのトレーニング効率で同等レベルを達成する場合、計算コストは1億ドルを超えると推定しています。
Magicは完全なトレーニングレシピを公開しておらず、効率向上はモデルアーキテクチャ、オプティマイザー、トレーニング目標、データ処理など数十の変更によるものだと述べるにとどめています。現在、モデルの重みもまだ公開されていないため、「50倍の効率」は外部による独立した再現がまだ不可能です。