動察 Beating AI 速報、Hy4 preview がオープンソース化されたばかりなのに、テンセント混元はまた極限量子化版をリリースした。元のモデル重みは約 1.5TB に近いが、新版の GGUF は約 214GB のみで、この 770B MoE モデルのローカルデプロイのハードルを大幅に引き下げた。
これはモデル全体を 1.25-bit に圧縮するわけではない。テンセントは層ごとの精度感度に応じて個別に量子化し、耐えられる部分は最低約 1.31-bit まで圧縮し、敏感な部分は 2-bit 以上を保持する。最終的にファイル全体の平均は約 2.38 bpw となる。テンセントが示した4つの評価では、BF16 オリジナル版と比較してわずか 0.2 から 1.6 ポイントの低下にとどまる。
圧縮後、テンセントは prima.cpp と協力して異種デバイスでの協調推論もテストした。RTX 4090 ノートPC 1台と4枚の A4000 サーバー1台で、合計 VRAM はわずか 80GB、メモリは 64GB しかないが、モデルを 1.02 token/s で実行でき、ノートPC単体のオフロードより約6倍高速だった。異なる構成の複数デバイスでも、モデル推論を共同で分担できる。