動察 Beating AI 速報、Artificial Analysis が昨夜のいくつかの新モデルについて第三者による実測を完了した。Claude Opus 5.5 max は Intelligence Index v4.3 で58点を獲得し、現在首位。GPT-6 Astra と Fable 5.1 はともに53点、Opus 5 は51点。Opus 5.5 は10項目の評価で6項目の最高得点を獲得した。
しかしこの最高得点はより多くの token も消費した。Opus 5.5 max は1タスクあたり平均約11.9万 tokens を出力し、Opus 5 の7.3万より約60%多い。API 20%値下げとキャッシュ読み取り60%値下げにより、1タスクあたりのコストは最終的に5.98ドルとなり、Opus 5 の5.86ドルとほぼ同等。より実用的な medium グレードは51点を獲得し、すでに Opus 5 max に並び、1タスクあたりのコストはわずか1.34ドル。
OpenAI は別の道を歩んでいる。GPT-6 Sol と Luna の Intelligence Index の成績は GPT-5.6 の前世代に近いが、価格は明らかに下落した。Sol max は1タスクあたりのコストが1.99ドルから1.06ドルに下がり、Luna は0.18ドルから0.07ドルに下がった。コーディング Agent 評価では、Sol は55点から57点に上昇し、コストも約半分に低下。Luna は43点から41点に下がったが、1タスクあたりのコストは約60%低い。
両社の路線はすでに分化し始めている。Opus 5.5 はより多くの推論で能力の上限を新たな高みに押し上げ、GPT-6 Sol と Luna は主に既存の能力をより安くした。Artificial Analysis の性能/コスト図では、両社の新モデルが新たな Pareto フロンティアを占めている。