動察 Beatingのモニタリングによると、テンセント混元チームは複数の大学と協力し、AIエージェントが端末上で複雑なタスクを継続的に完了できるかどうかをテストするためのLHTBを発表しました。
このベンチマークには46のタスクが含まれており、ソフトウェアエンジニアリング、実験の再現、科学計算、マルチモーダル分析などの分野をカバーしています。各タスクは最大90分間実行され、通常は数百ステップの連続操作が必要です。
LHTBは最終的な成功・失敗だけでなく、タスクの一部が完了した場合も実際の進捗に応じてスコアを付与します。隠しバリデーターがファイル、テスト結果、プログラム出力をチェックするため、エージェントが自称で完了したと主張しても無効です。
論文の初版では15のモデルがテストされました。GPT-5.5は7つのタスクを完了し、1位となりました。各モデルが1つのタスクを実行する際、平均で約990万トークンを消費し、約85分を要しました。
現在公開されている結果は20のモデルに拡大されています。Grok 4.5は平均スコア0.505でトップとなり、13のタスクを完了しました。46のタスクのうち、依然として29のタスクはどのモデルも完了基準に達していません。
ほとんどのエージェントは一部のステップを完了できるものの、しばしば90分を使い切ったり、タスクが未完了のまま早期に終了したりして、複雑なタスクを本当に最後までやり遂げることができません。