動察 Beating AI 速報、NVIDIAは記事を発表し、阿里巴巴の最新プレビューモデルQwen3.8-Flash-NextがNVIDIA GB300 NVL72プラットフォームのサポートを獲得したと述べた。このモデルの総パラメータ規模は1760億、トークンごとに約60億のパラメータが活性化され、ネイティブで26.2万トークンのコンテキストをサポートし、YaRNを通じて100万トークンまで拡張可能で、主にスマートプログラミング、文書処理、ツール呼び出しなどの長いコンテキストのエージェントアプリケーションを対象としている。
NVIDIAは、Qwen3.8-Flash-NextがGated DeltaNet(GDN)とQwen Sparse Attention(QSA)のハイブリッドアーキテクチャを採用し、長いコンテキストシナリオでの計算およびKVキャッシュのオーバーヘッドを削減すると述べている。テストによると、GB300 NVL72上で、このモデルの単一GPUスループットは1.6万トークン/秒を超え、単一ユーザーのスループットは200トークン/秒を超える。また、SGLang、vLLM、TensorRT-LLMなどの推論フレームワークをサポートしている。