動察 Beatingのモニタリングによると、美団(Meituan)は超大規模混合専門家(MoE)モデル「LongCat-2.0」をオープンソース化した。このモデルは総パラメータ数1.6兆、単一トークンあたりの活性化パラメータは約480億、1Mの超長コンテキストをサポートする。
これは業界初の国産計算リソースのみでトレーニングから推論までの全プロセスを完了した、1兆パラメータ規模の大規模モデルである。5万枚以上の国産AIチップクラスター上で35兆トークンの事前トレーニングを実施し、国産計算リソースが最先端の大規模モデルを支えるエンジニアリング安定性を実証した。
LongCat-2.0の主要なアップデートは、長コンテキストと推論効率に集中している。LongCat Sparse Attention(LSA)は、スパースアテンションインデックスによるメモリ読み取りと計算オーバーヘッドに対処するため、ストリーム認識インデックス、クロスレイヤーインデックス、階層型インデックスを導入。これにより、長文推論時のインデックス読み取りがより連続的になり、隣接層間で一部のインデックス結果を再利用できる。
モデルにはさらに、1350億パラメータの5-gram埋め込みモジュールが統合されており、隣接トークンの組み合わせをモデル化することで埋め込み空間を拡張し、局所的なコンテキスト表現を強化する。MoE専門家ルーティングのみに依存する場合と比較して、このような前置き埋め込みは、大バッチ推論におけるメモリ読み書き負荷の一部を軽減できる。
SWE-bench Proなどの主要なエージェントおよびコード評価において、LongCat-2.0は一部の主流クローズドソースモデルに迫る、あるいはそれを上回るパフォーマンスを示している。