動察 Beatingのモニタリングによると、OpenAIはARC-AGI-3の汎用評価フレームワークがGPT-5.6 Solの過去の推論を保存せず、コンテキストが長くなりすぎると初期の記録を削除すると述べている。そのため、モデルは既に発見したゲームルールを頻繁に忘れ、実行のたびに再考が必要となる。
その後、OpenAIは自社のResponses APIを使用して評価フレームワークを再構築し、過去の推論を保持し、長すぎるコンテキストを圧縮した。その結果、GPT-5.6 Solのスコアは13.3%から38.3%に上昇し、出力Tokenは約6分の1に減少した。
しかし問題は、Opus 5も同じ汎用フレームワークを使用している点にある。Opus 5はHigh推論モードで30.2%を獲得したのに対し、GPT-5.6 Solはより高いMaxモードを使用しても13.3%に過ぎなかった。フレームワークは確かにGPT-5.6のパフォーマンスを低下させたが、Opus 5を同様に低下させることはなかった。
OpenAIがどのように言い訳をしようとも、この世界で最も難しいAI評価において、Opus 5は明らかにGPT-5.6よりも優れている。