動察 Beating AI 速報、OpenAI が9月3日にGPT-6 Astraを発表して以降、複数のモデル評価ベンチマークデータが継続的に調整され、一部の修正によりAstraの性能が優位に見える一方、競合他社モデルのスコアが低下する事例もあり、AIの「スコア稼ぎ」や評価の透明性に対する外部からの疑問が生じている。
その中で、Astraの幻覚率は4.2%から2%に引き下げられ、GPT-5.6 Solは12.2%から9.4%に低下したが、その後両者はそれぞれ4.2%と12.2%に戻された。数学評価では、AnthropicのFable 5.1のスコアも87.8%から78%に低下し、現在は83%まで回復している。GPT-5.6 Solは83%から80.5%に低下し、その後83%に戻された。
さらに、AstraのARC-AGI-3評価における成績は、公開前の草稿の98.6%から最終ページの99.99%に引き上げられ、プログラミング評価のスコアも57.7%から57.9%へ小幅に上方修正された。OpenAIは、評価結果はモデルバージョン、ツール構成、推論レベル、テスト実行などの要因に影響を受けるとし、今回の調整はデータがモデルの最適性能をより正確に反映することを確保するためだと述べている。
ただし、スタンフォード大学の研究者は、頻繁な評価の再実行には、テスト条件を調整してベンチマークスコアを最大化する「Benchmaxxing」と呼ばれる行為が関与する可能性があると指摘している。業界関係者によると、AIモデル競争の激化に伴い、評価データはモデル能力の測定や市場獲得の重要なツールとなっており、ベンチマークテストの透明性と再現性をどう高めるかがますます注目されている。