動察 Beating AI 速報、Scale AI 傘下の研究機関 Scale Labs が Elorian と共同で新しい評価「Humanity’s Sixth Sense(HSS)」を発表した。これは、AI が画像や動画から暗黙の情報を読み取れるかを専門にテストするものだ。522 問の自由回答式問題は、288 枚の画像と 234 本の動画をカバーしている。例えば、2 台の車の間を通れるか、女性がバスを追いかけているときに突然歩調を緩めた理由、ある場面で誰がより発言力を持つか、などだ。
研究チームは 25 種類のマルチモーダルモデルをテストし、20 人の人間被験者にも解答させた。人間の正答率は 93.1% に達したが、1 位の GPT-6 Astra でも最大推論力度を使った場合で 53.6% にとどまった。GPT-6.1 Sol と Claude Opus 5.5 はそれぞれ 46.6% と 44.6% を獲得し、全モデルの得点中央値はわずか 30.9% だった。
研究者は 8573 回のモデル失敗を分析し、94% が重要な手がかりの見落とし、対象の誤認、または画面内の暗黙の関係を推論できないことに関係していると判明した。論理推論の誤りに分類されたものは約 5% のみだった。社会的理解は特に難しく、25 モデル中 21 モデルがこの種の問題で最も悪い成績だった。動画問題も一般的に画像問題より難しかった。
推論量を増やしても必ずしも有効とは限らない。モデルは平均して 1 問あたり約 4000 の推論 token を消費し、一部の問題では長く考えるほど成績がかえって悪化した。研究チームはまた、Agent に画面を拡大、トリミング、繰り返し確認させることも試み、成績はある程度向上したが、依然として人間との間に明らかな差があった。