動察 Beating AI 速報、香港大学MMLabが主導するロボット操作評価プロジェクトチームRoboDojoが、型破りな実験を行った。彼らはGPT-6 Astraに訓練済みのロボットポリシーを追加で組み込むのではなく、この汎用マルチモーダルモデルにカメラを直接見させ、ロボットの状態を読み取り、タスクを理解し、次の動作を自ら決定させた。間には固定の制御ツール一式だけがあり、Astraが出力した目標位置をロボットアームの動作に変換する。
42項目のシミュレーションタスクで、Astraは28.97点、平均成功率22.48%を獲得し、元の公開首位DM0.5の24.90点、19.34%を上回った。同じ制御方式をGPT-5.5に変えると、わずか1.13点、0.88%だった。
RoboDojoの公開ランキングはこれまで主にVLAやWAMといった専用訓練されたロボットポリシーが占めていた。今や、本来専用モデルで完成させる必要があった動作決定の一部を、汎用大規模モデルが直接引き継ぐことができ、しかも全体の成績は元の首位を超えている。ロボットに別途「脳」を訓練する必要があるのかという問題が、初めて具体的になった。
しかしAstraはまだロボットの「小脳」にはなれない。挿入、液体を注ぐ、精密接触といった実際の物理制御に依存するタスクでは、明らかに弱い。実機テストでは危険な動作が何度も発生しハードウェアを損傷したため、チームによって早期に中止された。
汎用モデルの能力が高まるにつれ、ロボットモデルの役割分担は再編される可能性がある。大規模モデルが環境を理解し、判断し、計画を立てることを担当し、専用VLAと従来のコントローラーが動作を正確かつ安定して実行することを担当する。