lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

テンセントT1はAgentの長期的なタスクに特化:300ラウンド以上の連続操作で、スコアが20ポイント上昇

動察 Beating AI 速報、テンセントは Qwen3.5-122B-A10B を専用にターミナル Agent の訓練に投入し、T1 を開発した。主に Linux ターミナル内の複雑なタスクを処理し、1つのタスクで最大300ラウンド以上連続してツールを呼び出せる。Terminal-Bench 2.1 のスコアはベースモデルの43.8%から64.0%に上昇し、20.2ポイント伸びた。


この20.2ポイントのうち、大部分は強化学習によるものだ。SFT はスコアを49.4%までしか引き上げられず、その後の強化学習でさらに14.6ポイント上昇した。チームは約1.5万のターミナルタスクを用意し、各タスクには自動テストが付属している。Agent がタスク全体を完了しなくても、一部の要件を達成するだけで対応する報酬を得られる。


長いタスクにはもう一つの問題がある。Agent が実際に作業する時と、その後その経験で訓練する時では、同じ文の内容が異なる token に再分割される可能性があり、MoE も別のエキスパート群に処理を切り替えることがある。T1 はその時に生成された token と選択されたエキスパートをすべて記録し、訓練時にそのままリプレイすることで、この訓練・推論間の偏差を約3分の1に抑えた。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了