lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

情報が何度も変更されると、大規模モデルは混乱する。最も性能の高いGPT-5.5でも正答率は59.3%にとどまる。

動察 Beating AI 速報、Tencent HunyuanなどのチームがEvolveScalerを発表した。これは大規模モデルが絶えず変化する情報に追随できるかを専門的にテストするものだ。長文テキストに修正・撤回・追記・無効化の情報を次々と加え、モデルに最新の状態に基づいて質問に答えさせる。


例えば、まずモデルに40日分のゲーム記録を見せ、こう尋ねる:「もし7日目にあの小ボスを倒していなかったら、最終的に勝てるのか?」これは以降の装備・HP・戦闘結果を連鎖的に変える。モデルは7日目から後続の数十日分を再推論しなければならず、原文にはそのままの答えはない。


チームは117種類のタスク、159種類の質問を設計し、最長で約1200イベントに及ぶ。14のモデル構成にはGPT-5.5、Gemini 3.1 Pro、DeepSeek V4 Preview Pro、GLM-5.2、Qwen3.5 Plusが含まれる。最難関の難易度では、成績の中央値はわずか11.3%;最も優れたGPT-5.5-xhighでも59.3%にとどまった。


このデータセットはモデルの訓練にも利用できる。社内のA3Bモデルにこの種のデータ6000件を追加したところ、8つの外部テストですべて向上し、平均5.25ポイント改善した。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了