動察 Beatingのモニタリングによると、千問は正式にQwen3.8-27Bをオープンソース化し、公式ベンチマークスコアも同時に公開しました。このわずか27Bパラメータのローカルモデルは、公式が発表した直接比較可能な8項目のテストすべてで、Metaが先ごろ公開した30BモデルのMuse Glimmerを上回りました。
差は特にエージェントとプログラミングの分野で顕著です。Terminal-Bench 2.1では、Qwen3.8-27Bが73.0点、Muse Glimmerが51.7点でした。SWE-bench Proでは61.7対51.2、OSWorld-Verifiedでは84.3対65.9です。汎用推論、ドキュメント、ビジョンテストでもすべてリードしています。
さらに驚くべきは、Claude Opus 4.6との比較です。両方にスコアがある19項目のテストのうち、Qwen3.8-27Bは15項目で勝利しました。SWE-bench Pro、LiveCodeBench、OSWorld、AndroidWorld、および複数のビジョンタスクで逆転しています。一方、Terminal-Bench、GPQA、HLE、NL2Repoでは依然として遅れを取っています。
個人のPCでローカル実行できる27Bモデルが、公式ベンチマークで前世代のクローズドソースフラッグシップのレベルに達しています。