lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Grok 4.5がテンセント混元エージェント耐久力ランキングでトップに立ち、6割以上のタスクがモデルなしで完了。

動察 Beatingのモニタリングによると、テンセント混元チームは複数の大学と協力し、AIエージェントが端末上で複雑なタスクを継続的に完了できるかどうかをテストするためのLHTBを発表しました。

このベンチマークには46のタスクが含まれており、ソフトウェアエンジニアリング、実験の再現、科学計算、マルチモーダル分析などの分野をカバーしています。各タスクは最大90分間実行され、通常は数百ステップの連続操作が必要です。

LHTBは最終的な成功・失敗だけでなく、タスクの一部が完了した場合も実際の進捗に応じてスコアを付与します。隠しバリデーターがファイル、テスト結果、プログラム出力をチェックするため、エージェントが自称で完了したと主張しても無効です。

論文の初版では15のモデルがテストされました。GPT-5.5は7つのタスクを完了し、1位となりました。各モデルが1つのタスクを実行する際、平均で約990万トークンを消費し、約85分を要しました。

現在公開されている結果は20のモデルに拡大されています。Grok 4.5は平均スコア0.505でトップとなり、13のタスクを完了しました。46のタスクのうち、依然として29のタスクはどのモデルも完了基準に達していません。

ほとんどのエージェントは一部のステップを完了できるものの、しばしば90分を使い切ったり、タスクが未完了のまま早期に終了したりして、複雑なタスクを本当に最後までやり遂げることができません。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了