(动作模型)融合: 3%全自回归模型WorldVLA来了

2025-07-23 06:14:50      来源:开封网

岑俊,阿里巴巴达摩院具身智能大模型算法研究员,博士毕业于香港科技大学。研究方向主要是:具身智能VLA模型,世界模型。

阿里巴巴达摩院提出了WorldVLA,首次将世界模型(WorldModel)和动作模型(ActionModel/VLAModel)融合到了一个模型中。WorldVLA是一个统一了文本、图片、动作理解和生成的全自回归模型。

论文标题:WorldVLA:TowardsAutoregressiveActionWorldModel

代码地址:https://github.com/alibaba-damo-academy/WorldVLA

研究简介

近年来,视觉-语言-动作(Vision-Language-Action,VLA)模型的发展成为机器人动作建模研究的重要方向。这类模型通常是在大规模预训练的多模态大语言模型(MultimodalLargeLanguageModels,MLLMs)基础上,添加一个动作输出头或专门的动作模块,以实现对动作的生成。MLLMs在感知和决策方面表现出色,使得VLA模型在多种机器人任务中展现出良好的泛化能力。然而,这些模型存在一个显著的局限性:它们往往缺乏对动作本身的深入理解。在现有方法中,动作只是作为输出结果处理,并未被当作输入进行分析和建模。相比之下,世界模型(WorldModels)能够基于当前观测与动作预测未来的视觉状态,从而同时理解视觉信息和行为动态。尽管具备这一优势,世界模型却无法直接生成动作输出,这导致其在需要显式动作规划的应用场景中存在功能上的空白。

为了解决VLA模型与世界模型各自的局限,我们提出WorldVLA——一种基于自回归机制的统一动作与图像理解与生成模型。如下图所示,WorldVLA使用三个独立的编码器分别处理图像、文本和动作数据。不同模态的token被设计为共享相同的词表,从而使得在同一个语言模型架构下可以统一完成跨模态的理解与生成任务。

其中,世界模型部分通过输入动作来生成对应的视觉表示,从而学习环境中的物理动态规律。这种对动作的解读与物理世界的建模对于动作模型的决策至关重要。与此同时,嵌入在WorldVLA中的动作模型也反过来增强了对视觉信息的理解,进一步提升世界模型在图像生成方面的准确性。这种双向增强机制使整个系统在理解和生成图像与动作方面更加鲁棒和全面。

此外,已有研究表明,动作分块(actionchunking)和并行解码技术对动作模型的性能有显著影响。然而,我们在实验中发现,在自回归模型中连续生成多个动作时会导致性能下降。主要原因在于,预训练的多模态语言模型主要接触的是图像和文本,而对动作的学习较少,因此在动作生成任务中泛化能力有限。而在自回归模型中,后续动作的生成依赖于前面的预测结果,一旦出现错误,便会随时间不断传播放大。为了解决这一问题,我们提出了一种动作注意力掩码策略(actionattentionmaskingstrategy),在生成当前动作时选择性地屏蔽掉之前的动作信息。这种方法有效缓解了错误累积的问题,在动作分块生成任务中带来了显著的性能提升。

在LIBERO基准测试中,我们的WorldVLA相比使用相同主干网络的传统动作模型,在抓取成功率上提升了4%。相较于传统的世界模型,WorldVLA在视频生成质量上表现更优,FVD(FréchetVideoDistance)指标降低了10%。这些结果充分说明,将世界模型与动作模型融合所带来的协同增益,验证了图像与动作统一理解与生成框架的优势。在动作分块生成任务中,传统自回归方式会导致抓取成功率下降10%到50%。但引入我们的注意力掩码策略后,性能下降得到了明显缓解,抓取成功率提升了4%到23%。

研究方法

VLA模型可以根据图像理解生成动作;世界模型可以根据当前图像和动作生成下一帧图像;WorldVLA将将两者融合,实现图像与动作的双向理解和生成,如下图所示。

WorldVLA使用独立的编码器分别处理图像、文本和动作,并让这些模态共享同一个词汇表,从而在单一的大语言模型架构下实现跨模态的统一建模。这种设计不仅提升了动作生成的准确性,也增强了图像预测的质量。WorldVLA使用ActionModel数据和WorldModel数据来训练模型。ActionModel是根据图片输入和文本指令输入来输出动作,数据格式如下:

WorldModel根据当前帧图片和动作来生成下一帧图片,数据格式如下:

在一次性输出多个action时,使用默认的自回归范式会使得效果变差。原因是动作模态并不在原本多模态大模型的预训练中,因此泛化能力较差,这样生成多个动作时就会有误差累积的问题。为了解决这个问题,WorldVLA提出了一种attentionmask策略,使得生成动作时只能看见前面的图片而不能看见前面的动作,从而解决动作累计误差问题,如下图所示。

实验结果

在LIBERObenchmark上的实验结果如下图所示,在没有预训练的情况下超越了需要预训练的全自回归模型OpenVLA。

下图为actionmodel的消融实验结果。对比row2和row1以及row5和row4可以看出,worldmodel的加入可以给actionmodel带来更好的结果。Row3可以看出,使用默认的attentionmask会导致某些任务的成功率下降,但是从row4看出,我们提出的attentionmask可以全面大幅提升任务的成功率。

ActionModel可视化(Text+Image->Action)

下图可以看出WorldVLA可以根据指令完成对应的动作。

WorldModel可视化(Action+Image->Image)

下图可以看出WorldVLA可以根据动作和图片来生成下一帧图片。

  [环球时报特约记者 任重]英国政府当地时间13日以“打击普京的战争机器”为由宣布50项新制裁,对象包括5家中国实体。中国驻英国使馆发言人当天回应说,英国政府罔顾国内国际民意,不断火上浇油,不但没有反思自己的恶劣行径,反而罗织罪名制裁中国及其他国家企业,充分暴露了英方的虚伪嘴脸。中方敦促英方立即纠正错误,撤销对中国企业的制裁。

责编:骆依波编辑

十日终焉第一季

  据英国政府13日发表声明称:“今天的行动包括英国首次针对俄罗斯总统‘影子舰队’中的船只实施制裁,俄罗斯利用这些船只规避英国和七国集团(G7)的制裁,并继续不受限制地进行石油贸易。”这些新制裁还针对俄罗斯军方的弹药、机床、微电子和物流供应商,包括位于中国、以色列、吉尔吉斯斯坦和俄罗斯的实体。声明写道,英国首相苏纳克在意大利参加G7峰会时宣布了这些新的制裁措施,“这将削弱俄罗斯为其战争机器提供资金和装备的能力”。

丝路友谊偕行致远

  中国驻英国使馆发言人强调,在乌克兰问题上,中国的立场是劝和促谈,坚定不移,一以贯之。为此,中国和巴西最近联名发表了关于推动政治解决乌克兰危机的“六点共识”,强调遵守局势降温三原则,即战场不外溢、战事不升级、各方不拱火,同时呼吁各方坚持对话谈判、加大人道主义援助、反对使用核武器、反对攻击核电站、维护全球产业链供应链稳定等。

中国女排比意大利女排

  中央要求谋划新一轮财税改革,税制改革是重头戏,未来增值税、消费税、个税等主要税种还将有进一步改革举措。笔者呼吁,在税收征管不断强化的同时,为促进企业、个人实际税负维持在合理水平,未来税制改革应当统筹考虑降低名义税率。

蜜雪冰城房塌了

  连日来,河南多地持续高温出现不同程度旱情,引发关注。目前河南情况如何?当地采取了哪些抗旱措施?国家对抗旱又有何举措?一文速览。

硬座结膜炎

  中国煤矿文工团成立于1947年东北解放区,是国家级艺术院团中历史最悠久的单位之一。2005年,加挂了“中国安全生产艺术团”的牌子。2018年9月,转隶到文化和旅游部。

男子奶茶内放精神药品猥亵女子

  截至6月13日,全省大、中型水库可用水总量40.48亿立方米,储量充足有保证,按照6月底前无有效降雨的最不利因素考虑,可放水7亿立方米用于抗旱灌溉;南水北调中线工程、大中型水库及河道供水正常,地下水源较充沛,能够满足抗旱需求。5月下旬以来,对全省98.72万眼农田建设灌溉机井和56.85万项灌排沟渠设备进行全面排查,及时修复损坏设施,确保抗旱灌溉需要。省财政近期专门安排3000万抗旱专项资金,支持各地开展抗旱工作。/p>

保护情绪和保护健康一样重要

  2023年7月,中共中央总书记、国家主席、中央军委主席习近平在四川考察时指出,四川要发挥高校和科研机构众多、创新人才集聚的优势和产业体系较为完善、产业基础雄厚的优势,在科技创新和科技成果转化上同时发力。/p>

央视曝光高端酱香老酒竟是酒精勾兑

  随着参与网球运动的人逐渐增多,中国网球的基础设施也在不断完善。纪宁告诉《环球时报》记者:“我们在做一个项目,在北京朝阳区规划一个‘大满贯网球文化公园’,将汇集所有大满贯要素。人们既能在此观看全球顶级赛事,也能在场地上训练和比赛。”纪宁说,这仅是一个案例,但从中可以窥见中国网球运动基础设施越来越完善,也越来越专业化。作为体育产业的参与者与观察者,纪宁表示,不仅北京,全国各地网球运动设施也发展得越来越好。