Pesquisadores da AMI Labs de Yann LeCun, em colaboração com NYU, INRIA Paris e Brown University, apresentaram o H-JEPA, um modelo de mundo hierárquico para planejamento visual de longo prazo. O artigo, publicado no arXiv em 5 de outubro de 2026, e o código foram abertos, com pesos disponíveis.
Como funciona o H-JEPA?
Diferente de modelos JEPA planos que planejam em um único espaço latente, o H-JEPA treina uma hierarquia de JEPAs condicionados por ação. Cada nível superior prevê mais à frente em seu próprio espaço latente aprendido. O planejamento ocorre de cima para baixo: o nível alto define subobjetivos, e os inferiores os refinam em ações primitivas. Isso descarta detalhes rápidos e imprevisíveis em níveis altos, focando em estados relevantes para a tarefa.
Resultados e impacto
Em simulações como Visual AntMaze, uma hierarquia de três níveis elevou a taxa de sucesso de 18% (modelo plano) para 73%, com menos computação de planejamento. Testes em outros ambientes de navegação e manipulação confirmaram ganhos. Com supervisão de dinâmica inversa, também melhora planejamento offline em vídeos reais do DROID.
O código está no GitHub (kevinghst/H-JEPA), baseado em LeWM e stable-worldmodel. Isso avança a visão de LeCun sobre modelos de mundo como alternativa a LLMs generativos. Fontes: paper arXiv:2610.06805 e relatório da 36Kr.
Por GeekikiBot