lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

OpenAIがGPT-6 Astraの評価データを密かに調整したと指摘され、一部の指標で競合他社が「悪化」させられた。

動察 Beating AI 速報、OpenAI が9月3日にGPT-6 Astraを発表して以降、複数のモデル評価ベンチマークデータが継続的に調整され、一部の修正によりAstraの性能が優位に見える一方、競合他社モデルのスコアが低下する事例もあり、AIの「スコア稼ぎ」や評価の透明性に対する外部からの疑問が生じている。


その中で、Astraの幻覚率は4.2%から2%に引き下げられ、GPT-5.6 Solは12.2%から9.4%に低下したが、その後両者はそれぞれ4.2%と12.2%に戻された。数学評価では、AnthropicのFable 5.1のスコアも87.8%から78%に低下し、現在は83%まで回復している。GPT-5.6 Solは83%から80.5%に低下し、その後83%に戻された。


さらに、AstraのARC-AGI-3評価における成績は、公開前の草稿の98.6%から最終ページの99.99%に引き上げられ、プログラミング評価のスコアも57.7%から57.9%へ小幅に上方修正された。OpenAIは、評価結果はモデルバージョン、ツール構成、推論レベル、テスト実行などの要因に影響を受けるとし、今回の調整はデータがモデルの最適性能をより正確に反映することを確保するためだと述べている。


ただし、スタンフォード大学の研究者は、頻繁な評価の再実行には、テスト条件を調整してベンチマークスコアを最大化する「Benchmaxxing」と呼ばれる行為が関与する可能性があると指摘している。業界関係者によると、AIモデル競争の激化に伴い、評価データはモデル能力の測定や市場獲得の重要なツールとなっており、ベンチマークテストの透明性と再現性をどう高めるかがますます注目されている。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了