H-JEPA、階層化でロボット計画を高精度・省計算に
階層計画の仕組み
詳細を読む
2026年10月9日、VentureBeatは、ヤン・ルカン氏のAdvanced Machine Intelligence(AMI)Labsと大学の研究者が、異なる時間軸ごとに環境表現を学ぶ世界モデル「H-JEPA」を開発したと報じました。長期目標を扱う上位層から目先の動作を担う下位層へ計画を段階的に落とし込み、従来の単層JEPAよりナビゲーション精度を高めながら、計画時の計算量を減らします。
生成モデルが画素単位の詳細まで予測するのに対し、JEPAは画像や動画を情報量の小さい潜在表現に変換し、行動後の状態を予測します。従来方式は、細かな運動と遠い目標を同じ表現で扱うため、長い行動列では計算量が増え、誤差も連鎖しやすい課題がありました。
H-JEPAは各階層に状態エンコーダー、行動エンコーダー、予測器を置き、下位層ほど短時間の物理動作、上位層ほど長時間の変化を学習します。上位層が潜在空間で目標に近づく行動を探して中間目標を渡し、下位層が実行可能な基本動作まで具体化します。
研究チームはFourRoom Distractors、Visual AntMaze、Push-T、OGBench Cubeの4環境で検証しました。FourRoom、AntMaze、Cubeでは最大3階層まで層を増やすと概して成功率が上がり、計画計算量は減少し、AntMazeの3階層モデルは比較対象HWMの約2倍の成功率を記録しました。
実ロボット動画データDROIDでは、状態間の行動を当てる「逆動力学」の学習目標を加え、行動に必要な情報を保持しました。基準手法より少ない計算量でオフライン計画の忠実度を高めましたが、階層は多いほど常に良いわけではなく、効果は学習データの範囲に左右されます。
倉庫自動化やロボット操作では、目的地の判断と関節制御のような異なる粒度の判断を両立させる必要があります。H-JEPAはこの分離に有望ですが、現時点の評価はシミュレーションと動画データが中心で、研究者らは将来、上位表現を言語と結び、画像ではなく指示で目標を与える方向を示しています。