LeCun团队世界模型新突破:PEVA模型实现具身智能体16秒连贯场景预测
作者:红鹰工作手机apiweixin.cn 发布时间:2025-07-17 21:00:02
在Meta的AI领域,Yann LeCun无疑是一位举足轻重的人物。作为图灵奖得主、深度学习三巨头之一,他的每一个动作都备受关注。然而,在扎克伯格亲自带队Meta的AI项目,以千亿薪酬挖得硅谷人心浮动之际,LeCun却似乎销声匿迹,没有参与到LLM基础模型的研发中,社交网络上也不见了他的身影。这不禁让人猜测,LeCun是否要离开Meta?
事实并非如此。LeCun可能正在酝酿一个大招,那就是他一直追逐的世界模型。最近,LeCun团队的世界模型新进展——PEVA模型,终于浮出水面。这个新模型让具身智能体学会了像人类一样的“预判能力”,首次实现了16秒连贯场景预测。
想象一下,当我们伸手去拿东西时,我们会预判手臂进入视野的角度;当我们走路时,我们会提前观察脚下的路径。PEVA模型就是让机器人也能实现这样的能力。它通过结构化动作表示,将人体48维关节运动学数据与条件扩散Transformer结合,利用VAE编码视频帧、自适应层归一化嵌入动作条件及跨历史帧注意力机制等,实现了从全身动作预测第一视角视频的高精度生成与长期时序连贯。
PEVA模型的创新之处在于,它摒弃了传统模型中使用的抽象控制信号,而是采用了真实物理基础上的复杂动作空间。通过结构化动作表示,模型能够完整捕捉人体运动中的“整体动作”与“细微关节变化”的双重信息。这种表示方法的核心目标,就是让智能体在多样化的现实场景中,以第一人称视角行动,从而“模仿”人类的第一视角下的动作与感知。
技术实现上,PEVA模型采用了运动学树结构编码、局部坐标系转换、归一化与差分表示等方法,将人体全身运动转化为模型可理解的高维结构化数据。同时,通过条件扩散Transformer架构,模型学会了“预测”能力,能够高效捕捉动作与视觉之间的高度非线性关系以及延迟效应。
在训练过程中,PEVA模型使用了Nymeria数据集,该数据集包含了同步的第一视角视频与全身动作捕捉数据,覆盖了真实场景中的日常动作。通过自回归扩散训练,模型确保了生成帧在动作驱动下保持时序连贯。
实验成果令人瞩目。PEVA模型在多项任务上表现优于基线模型,无论是单步预测还是长期视频生成,都展现出了更高的视觉相似度和生成质量。更重要的是,PEVA模型还具备智能规划能力,能在多个动作选项中筛选出最优解,轻松完成开冰箱、抓取目标物体等复杂任务。
有趣的是,LeCun曾多次公开表达对VAE的批评,认为其生成样本模糊。然而,在PEVA模型中,VAE却扮演了“视觉特征转换器”的角色。这一选择引发了网友们的讨论,有人认为LeCun的立场有所改变,也有人认为VAE是一种更实用的选择。
不管怎样,PEVA模型的出现无疑为具身智能体的发展带来了新的希望。如果智能体真能像人类一样预判行动,那么未来的扫地机器人就能提前“想”清楚路线,再也不会卡在桌角反复横跳了。而我们,也将迎来一个更加智能、便捷的生活时代。
论文地址:https://arxiv.org/abs/2506.21552
项目地址:https://dannytran123.github.io/PEVA/
让我们共同期待LeCun团队未来更多的创新成果吧!
文章分类
最新站内文章
联系我们
联系人:红鹰工作手机客服