lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Terminal-Bench 4.0:GLM-5.3が第3位に浮上、GPT-5.6 Solを上回る

動察 Beating AI 速報、Terminal-Bench が 4.0 をリリースし、Agent がタスク実行時の時間、CPU、メモリを再調整し、19 個のタスクを修正、飽和、拒否応答、公開解法、または品質問題が存在する 8 個のタスクを削除しました。すべてのタスクの最大実行時間は 8 時間に統一され、主にタイムアウトや環境問題が成績に与える干渉を減らすことを目的としています。


最新のランキングでは、Opus 5 + Claude Code が 51.8% で 1 位、Fable 5 が 44.5% で 2 位です。GLM-5.3 + Claude Code は 41.8% を獲得し、3 位に浮上し、GPT-5.6 Sol + Codex の 37.3% を上回りました。上位 3 位の中で、GLM-5.3 は Anthropic 以外の唯一のモデルです。


Terminal-Bench 3.0 では、GLM-5.3 は 32.4% で 4 位、GPT-5.6 Sol の 34.6% に遅れを取っていましたが、4.0 では GLM-5.3 が 3 位に上がり、逆に Sol を 4.5 パーセントポイント上回っています。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了