lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

2.78兆パラメータのKimi K3が8GBメモリで動作、開発者が軽量C推論エンジンをオープンソース化

BlockBeats ニュース、8月8日、ある開発者が最近オープンソースプロジェクト「kimi-k3-in-c」を公開し、2.78兆パラメータを持つKimi K3モデルをわずか8GBメモリのデバイス上で実行する試みを行った。このプロジェクトはわずか176KBで、純粋なC99で書かれており、GPU、CUDA、PyTorch、BLASに依存せず、CPUのみでモデル推論を完了できる。


このソリューションは、Kimi K3のMoE(混合エキスパート)アーキテクチャの特性を活用している。モデルの総パラメータ規模は2.78Tに達するが、各層の896エキスパートのうち16個のみが活性化されるため、開発者は完全な約1.56TBのモデル重みをメモリに読み込むのではなく、大部分のエキスパート重みをNVMeハードディスクに保存し、推論ニーズに応じてリアルタイムで読み取る。同時に、一部の高密度層(dense trunk)も層ごとのストリーミング読み込み方式を採用している。


ただし、このソリューションには現在も明らかな性能制限がある。8GBメモリモードでは、モデルが1トークンを生成するのに約32.7秒かかり、同時に約1.7TBの高速ストレージ容量が必要となる。


開発者は、このソリューションは現時点では大規模モデル推論インフラの最適化方向への実験的探求に近く、実際の生産利用価値はないと述べている。しかし、「ハードディスクのストリーミング読み込み+MoEスパース活性化」という方法により、将来の低コストでの超大規模モデル実行に新たな考え方を提供している。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了