動察 Beating AI 速報、楊立昆が創設した AMI Labs が複数の大学と共同で H-JEPA を発表した。これは未来を階層的に予測し、動作を計画できる世界モデルである。高層は長期的な目標を担当し、低層は具体的な動作を担当する。論文、コード、事前学習済み重みはすべて公開されている。
H-JEPA は JEPA の考え方を継承している。まず映像を抽象的な環境特徴に変換し、次に動作と組み合わせて未来の状態を予測するため、フレームごとに動画を生成する必要がない。しかし、長期計画と目先の制御では必要な情報が異なる。例えば四足歩行ロボットが迷路を歩く場合、経路の選択は主に位置と通路を見るが、脚を踏み出すには身体姿勢が欠かせない。単層モデルが同じ特徴セットで両方を兼ねると、計画が遠くなるほど苦しくなる。
H-JEPA は複数の JEPA を異なる計画階層として組み合わせる。高層はより遠い未来を予測し、途中の目標を下層に渡し、さらに段階的に具体動作へと細分化する。従来のように各層が同じ特徴セットを共有する HWM とは異なり、H-JEPA では各階層が独自の環境特徴を学習する。迷路実験では、高層は位置情報を保持し、脚の姿勢などの短期的な細部を次第に無視するようになった。楊立昆は早くも 2022 年に同様の構想を提唱していたが、今回チームはエンドツーエンドで訓練可能な実装案を示した。
Visual AntMaze のシミュレーション迷路では、3 つの計画階層を持つ H-JEPA の成功率は 73.3% に達し、単層の LeWorldModel は 18.0% だった。前者に必要な計画計算量はより少ない。ただし、計画階層は多ければ多いほど良いわけではない。物体を押すシミュレーションタスク Push-T では、3 層モデルはかえって 2 層モデルに劣った。チームは実ロボット映像データセット DROID を用いたオフラインテストも行い、動作軌跡の予測は単層モデルよりも専門家の模範に近かった。