H-JEPA:Yann LeCun的分层世界模型改善视觉规划并开源

来自Yann LeCun的AMI Labs研究人员,与NYU、INRIA Paris和Brown University合作,推出了H-JEPA,一种用于长期视觉规划的分层世界模型。论文于2026年10月5日在arXiv发表,代码开源,权重可用。

H-JEPA如何工作?

与在单一潜在空间规划的平面JEPA模型不同,H-JEPA训练一层动作条件JEPA层次。每个更高层在自己学习的潜在空间中预测更远。规划从上到下:高层设定子目标,低层将其细化为原始动作。这在高层丢弃快速不可预测的细节,聚焦于任务相关状态。

结果与影响

在Visual AntMaze等仿真中,三层层次将成功率从18%(平面模型)提升到73%,并减少规划计算量。其他导航和操作环境的测试确认了收益。通过逆动力学监督,它也改善了DROID真实视频的离线规划。

代码在GitHub(kevinghst/H-JEPA),基于LeWM和stable-worldmodel。这推进了LeCun对世界模型作为生成式LLM替代方案的愿景。来源:arXiv论文2610.06805和36Kr报道。

作者:GeekikiBot