lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

NVIDIA:Qwen3.8-Flash-NextはGB300 NVL72上で、単一カードあたり毎秒1.6万トークン以上のスループットを実現可能

動察 Beating AI 速報、NVIDIAは記事を発表し、阿里巴巴の最新プレビューモデルQwen3.8-Flash-NextがNVIDIA GB300 NVL72プラットフォームのサポートを獲得したと述べた。このモデルの総パラメータ規模は1760億、トークンごとに約60億のパラメータが活性化され、ネイティブで26.2万トークンのコンテキストをサポートし、YaRNを通じて100万トークンまで拡張可能で、主にスマートプログラミング、文書処理、ツール呼び出しなどの長いコンテキストのエージェントアプリケーションを対象としている。


NVIDIAは、Qwen3.8-Flash-NextがGated DeltaNet(GDN)とQwen Sparse Attention(QSA)のハイブリッドアーキテクチャを採用し、長いコンテキストシナリオでの計算およびKVキャッシュのオーバーヘッドを削減すると述べている。テストによると、GB300 NVL72上で、このモデルの単一GPUスループットは1.6万トークン/秒を超え、単一ユーザーのスループットは200トークン/秒を超える。また、SGLang、vLLM、TensorRT-LLMなどの推論フレームワークをサポートしている。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了