動察 Beating AI 速報、Tencent HunyuanなどのチームがEvolveScalerを発表した。これは大規模モデルが絶えず変化する情報に追随できるかを専門的にテストするものだ。長文テキストに修正・撤回・追記・無効化の情報を次々と加え、モデルに最新の状態に基づいて質問に答えさせる。
例えば、まずモデルに40日分のゲーム記録を見せ、こう尋ねる:「もし7日目にあの小ボスを倒していなかったら、最終的に勝てるのか?」これは以降の装備・HP・戦闘結果を連鎖的に変える。モデルは7日目から後続の数十日分を再推論しなければならず、原文にはそのままの答えはない。
チームは117種類のタスク、159種類の質問を設計し、最長で約1200イベントに及ぶ。14のモデル構成にはGPT-5.5、Gemini 3.1 Pro、DeepSeek V4 Preview Pro、GLM-5.2、Qwen3.5 Plusが含まれる。最難関の難易度では、成績の中央値はわずか11.3%;最も優れたGPT-5.5-xhighでも59.3%にとどまった。
このデータセットはモデルの訓練にも利用できる。社内のA3Bモデルにこの種のデータ6000件を追加したところ、8つの外部テストですべて向上し、平均5.25ポイント改善した。