杨立坤4年前的构想交卷:H-JEPA迷宫成功率从18%升至73%

2026-10-10 1 次阅读 RSS订阅
动察 Beating AI 快讯,杨立坤创办的 AMI Labs 联合多所高校公布 H-JEPA,一种能够分层预测未来、规划动作的世界模型。高层负责远期目标,低层负责具体动作。论文、代码和预训练权重均已公开。 H-JEPA 延续了 JEPA 的思路。它先把画面转成抽象的环境特征,再结合动作预测未来状态,不必逐帧生成视频。但长期规划和眼前控制需要的信息不同。比如四足机器人走迷宫,选路线主要看位置和通道,迈腿却离不开身体姿态。单层模型用同一套特征兼顾两件事,规划越远越吃力。 H-JEPA 将多个 JEPA 组成不同的规划层级。高层预测更远的未来,把中途目标交给下层,再逐步细化成具体动作。与此前各层共用同一套特征的 HWM 不同,H-JEPA 让每个层级学习自己的环境特征。在迷宫实验中,高层保留了位置信息,逐渐忽略腿部姿态等短期细节。杨立坤早在 2022 年就提出过类似构想,如今团队给出了可以端到端训练的实现方案。 在 Visual AntMaze 仿真迷宫中,三个规划层级的 H-JEPA 成功率达到 73.3%,单层 LeWorldModel 为 18.0%,前者所需的规划计算量更少。不过,规划层级并非越多越好。在模拟推物体的 Push-T 任务中,三层模型反而不如两层。团队还用真实机器人录像数据集 DROID 进行了离线测试,预测动作轨迹比单层模型更接近专家示范。

📰 来源:jinse.com.cn

💬 引用锚点
分层世界模型通过高层保留远期目标信息、低层学习具体动作特征,解决了单层模型在长程规划中信息混淆的问题。
实验表明规划层级并非越多越好,H-JEPA三层模型在迷宫任务成功率从18%提升至73%,但在推物体任务中两层反而优于三层。
各层级独立学习环境特征而非共用同一套参数,使得模型在减少规划计算量的同时能更准确地预测动作轨迹并接近专家示范。

常见问题

H-JEPA模型是什么?▼
H-JEPA在Visual AntMaze测试中的表现如何?▼
H-JEPA相比单层模型有哪些优势?▼
H-JEPA的构想源于何时?▼