動察 Beating のモニタリングによると、Arena Agent ランキングは実際のユーザータスクとツール呼び出し記録に基づいています。Kimi K3 の総合純改善率は 9.62% で、第4位にランクされました。これは Claude Fable 5、Claude Opus 4.8 Thinking、GPT-5.6 Sol に次ぐ順位です。
Arena は、評価対象の全モデルを均一に混合して仮想的な平均ベンチマークを作成し、K3 に置き換えた場合に各結果がどれだけ改善されるかを推定します。5つの指標の純改善率を平均し、総合スコアを算出します。
K3 はすでに 8344 回のテストセッションを蓄積しています。ユーザー確認成功指標の純改善率は 14.42% で、第1位を獲得。苦情よりも称賛が多い指標は 20.62% の改善で第3位。エラー修正実行は第14位、Bash エラー復旧は第17位でした。K3 はユーザーに認められる結果を出しやすい一方、途中修正やコマンドエラー復旧は依然として弱点です。