動察 Beating AI 速報、Terminal-Bench が 4.0 をリリースし、Agent がタスク実行時の時間、CPU、メモリを再調整し、19 個のタスクを修正、飽和、拒否応答、公開解法、または品質問題が存在する 8 個のタスクを削除しました。すべてのタスクの最大実行時間は 8 時間に統一され、主にタイムアウトや環境問題が成績に与える干渉を減らすことを目的としています。
最新のランキングでは、Opus 5 + Claude Code が 51.8% で 1 位、Fable 5 が 44.5% で 2 位です。GLM-5.3 + Claude Code は 41.8% を獲得し、3 位に浮上し、GPT-5.6 Sol + Codex の 37.3% を上回りました。上位 3 位の中で、GLM-5.3 は Anthropic 以外の唯一のモデルです。
Terminal-Bench 3.0 では、GLM-5.3 は 32.4% で 4 位、GPT-5.6 Sol の 34.6% に遅れを取っていましたが、4.0 では GLM-5.3 が 3 位に上がり、逆に Sol を 4.5 パーセントポイント上回っています。