動察 Beatingのモニタリングによると、OpenAIの研究者Noam Brownは、AIモデルの性能向上に伴い、モデルの良し悪しを測るベンチマークスコアが、徐々に推論時計算能力(つまりモデルが質問に回答する際に消費する計算リソース)に支配されているとの見解を発表した。単一の静的スコアでは、もはや強力なモデルの真の実力を反映できず、将来の評価基準は、推論計算能力または生成トークン数を横軸とする性能拡張曲線へと移行する必要がある。
Noam Brownは、新モデルGPT-5.5のテストプロセスを例に挙げ、初期の通常テストでは、GPT-5.5はGPT-5.4と比較して明確な優位性は見られなかった。しかし、より多くの推論計算能力が割り当てられると、GPT-5.5のパフォーマンスは爆発的に向上した。実行予算が制限されると、標準テストでは最先端モデルの真の上限を反映できなくなる。同様の性能拡張の傾向は、複数の外部評価によって確認されている。Andrej Karpathyのエージェント自律研究実験や、英国AI安全研究所の悪意あるネットワークテストでは、推論予算が増加するにつれて、GPT-5.5とMythosモデルのパフォーマンスは継続的に上昇し、1億以上のトークンを生成した後でも天井に達することはなく、より強力なモデルほど、より多くの計算能力を投入した際の性能向上が顕著であった。
推論計算能力の向上は、安全性評価をより複雑にしている。Noam Brownは警告する。現在の生物学的またはサイバーセキュリティ評価には、通常、固定された推論予算が設定されていない。国家レベルの敵対者が特定のタスクに1000万ドル以上の推論予算を投入した場合、一見安全に見えるモデルが危険なレッドラインを越える可能性がある。大規模モデルベンダーは新モデルをリリースする際に、トークン数、計算コスト、または実行時間を横軸とする性能曲線を積極的に公開すべきであり、評価機関も推論予算を評価の核心変数として位置付け、安全性評価において低計算能力テストから安全境界を外挿する必要がある。