動察 Beating AI 速報、Prime Intellect がオープンソースモデル推論サービス Prime Inference をリリース。
ユーザーはオンデマンドでモデルを直接呼び出せる。タスクが長期的に安定した運用を必要とする場合、事前に一部の推論コンピューティングリソースを確保することもできる。インターフェースは OpenAI API と互換性があり、最初に公開デプロイされたモデルは GLM-5.3 です。
このシステムは以前から Prime Intellect 内部で使用されていました。公式によると、1日あたり約1兆トークンを処理し、強化学習、合成データ、モデル評価、Coding Agent に使用されています。Prime Intellect は今年1月から顧客向けに大規模デプロイを運用してきました。
Prime Inference は Agent の長コンテキスト負荷の最適化に重点を置いています。プロンプト処理と応答生成を異なる GPU に分離し、テストでは p90 トークン間レイテンシを約40%削減しました。Prime Intellect はまた KV キャッシュを圧縮し、同じ VRAM で各デコーダがキャッシュできるトークン数を109万から163万に増やし、約50%の向上を実現しました。
Prime Intellect は以前から強化学習、評価、サンドボックスなどのトレーニングインフラを提供していました。推論サービスを加えることで、モデルのトレーニングと実際のデプロイを同じプラットフォームに接続でき、実際の運用で生成されたデータも後続のトレーニングに引き続き活用できます。