lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

OpenAIは、評価フレームワークがGPT-5.6のパフォーマンスを低下させたと述べているが、Opus 5は同じフレームワークで2.3倍高いスコアを記録した。

動察 Beatingのモニタリングによると、OpenAIはARC-AGI-3の汎用評価フレームワークがGPT-5.6 Solの過去の推論を保存せず、コンテキストが長くなりすぎると初期の記録を削除すると述べている。そのため、モデルは既に発見したゲームルールを頻繁に忘れ、実行のたびに再考が必要となる。

その後、OpenAIは自社のResponses APIを使用して評価フレームワークを再構築し、過去の推論を保持し、長すぎるコンテキストを圧縮した。その結果、GPT-5.6 Solのスコアは13.3%から38.3%に上昇し、出力Tokenは約6分の1に減少した。

しかし問題は、Opus 5も同じ汎用フレームワークを使用している点にある。Opus 5はHigh推論モードで30.2%を獲得したのに対し、GPT-5.6 Solはより高いMaxモードを使用しても13.3%に過ぎなかった。フレームワークは確かにGPT-5.6のパフォーマンスを低下させたが、Opus 5を同様に低下させることはなかった。

OpenAIがどのように言い訳をしようとも、この世界で最も難しいAI評価において、Opus 5は明らかにGPT-5.6よりも優れている。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了