wla论文笔记
World-Language-ActionModel for UnifiedWorldModeling,LanguageReasoning,andActionSynthesis
引言
核心见解是:下一个状态应当同时包含高层文本意图(High-level Textual Intention)和底层物理动态(Low-level Physical Dynamics)。具体而言:
- 高层文本意图:为未来状态提供了一种紧凑且具高度泛化能力的抽象表示,鉴于当前大语言模型(LLMs)的普及,这种表示很容易获取。
- 底层物理动态:作为连接高层意图与细粒度运动控制之间的桥梁,但它与高分辨率视觉状态的不同之处在于,它仅描述这些状态之间的转移关系。
世界-语言-动作(World-Language-Action, WLA)模型,是一类新型具身基础模型,旨在将这种下一状态预测与动作综合(Action Synthesis)结合起来
确定了几个关键的设计见解:
- 为世界专家配备轻量级的扩散 Transformer(如 SANA-600M),且仅预测静态的未来视觉帧而非完整视频剪辑,就足以捕获有效的物理动态。
- 由于世界预测是通过隐式参数更新而非显式条件建模来影响动作生成的,因此在推理期间可以完全禁用世界专家。
方法
该模型将多模态输入(图像、文本和机器人状态)映射到多模态输出(图像、文本和机器人动作)。 在每个时间步 t,模型处理当前观察 ot、历史观察 ot−h、本体感觉状态 qt 以及指令 l,预测一个 n 步的动作块(Action Chunk)at:t+n,在动作块之前是文本意图 l^ 和未来视觉状态 ot+n。执行 at:t+n 会以退界(Receding-horizon)的方式推动环境向 ot+n 演进,重复此过程直至任务完成。
世界-语言-动作模型 (World-Language-Action Models)
图2 (a) WLA由三个组件构成:一个用于下一状态预测的AR Transformer主干网络、一个用于预测未来观测值的世界专家(World Expert),以及一个用于生成动作的动作专家(Action Expert)。
(b) 在测试时扩展模式下,WLA执行具有最高预测价值的动作块(action chunk)。
WLA 采用自回归(AR)Transformer 主干网络,通过两种互补的表示来预测下一个状态:高层文本意图和底层物理动态 文本意图流为状态演化提供了语义蓝图,为机器人行为提供全局指导。与此同时,物理动态捕获状态转移,有效地将高层指令落实到底层运动模式中
文本意图学习 (Textual Intention Learning)
在训练时,我们首先构建一个与 l 对应的中间子任务序列 L^={l^1,l^2,...,l^N},其中每个子任务 l^k 与一个时间段 [sk,ek] 相关联。WLA 被训练用于预测跨越即将到来的动作时程 [t,t+n](即 skt≤t 且 ekt+n≥t+n)的连续子任务窗口 St={lkt,...,lkt+n}⊆L:
St=f(ot−h,ot,l,M)(3.1)
M 表示内存缓冲区,用作长时程任务后续预测的历史上下文。它将通过递归方式由 M←M⊕[l^kt,...,l^kt+n−1] 进行更新。
即:给出一个l指令,利用VLM的知识将l指令构建为中间子任务序列 L^={l^1,l^2,...,l^N},其中每个子任务 l^k 与一个时间段 [sk,ek] 相关联。WLA通过 过去和现在的摄像头画面、最初的那句完整用户指令以及内存缓冲区来预测一个时间段([t,t+n])内的子任务序列(St),子任务序列中的第一个子任务开始时间要早于t,最后一个子任务的结束时间要晚于t+n
物理动态建模 (Physical Dynamics Modeling)
在 AR 主干网络的上下文末尾附加一组元查询(Meta-queries)Q ,使其能够通过因果注意力机制聚合上下文信息,并使用输出定义物理动态 ht,即:
ht=f(ot−h,ot,l,M,St,Q)(3.2)
元查询就是一组“可学习的、没有具体内容的空令牌(Empty Tokens)”,专门用来帮模型“汇总上下文信息”。 在 Transformer 的因果注意力机制下,这群空白的元查询 Q 被附加(append)在上下文末尾。它们的任务就是听(注意力机制)。它们看着前面那一大堆上下文(画面、指令、子任务),利用注意力权重,自动决定要把哪些最重要的信息揉在一起。
世界专家 fwm 接收 ht 和原始状态 ot 的表示(例如由所用 VLM 的视觉编码器提供),以预测未来视觉状态 ot+n:
ot+n=fwm(ht,ot)(3.3)
fwm 并非直接预测 ot+n,而是预测其 VAE 特征表示。使用 VAE 特征而非 DINO 或 JEPA 等语义特征,因为我们框架中的物理动态已经在语义层面建模,不需要额外的语义归纳偏置。.
ht 包含了指导动作专家 fact 生成显式动作所需的最小充分信息。即有:
at:t+n=fact(ht,qt)(3.4)
qt代表当前时刻 t 的“机器人本体感受状态”
世界建模目标在训练期间通过共享参数学习来指导动作生成,而不是要求动作模型在测试时以显式预测的未来图像为条件。这种隐式范式使得 fwm 在推理期间可以被完全丢弃。这偏离了传统的“先图后动作”(Image-then-act)WAM,显著降低了测试时的延迟
训练目标 (Training Objective)
模型通过用于子任务生成的交叉熵损失 Llang 以及用于世界建模和动作预测的两个流匹配(Flow-matching)损失 Lwm 和 Lact 进行联合训练:
L=Lact+αLwm+βLlang(3.5)
其中 α 和 β 分别加权辅助世界建模损失和语言损失。
匹配流可以看原来的文章
推理优化 (Inference Optimization)
TTS 模式 (TTS Mode)
当计算资源更充裕时,WLA 可以切换到测试时扩展模式以进一步改善动作预测,如图 2 (b) 所示
给定当前观察,我们通过改变随机种子采样 K 个候选动作块 a^t:t+n(k)。对于每个候选 k,世界专家预测出对应的未来静态帧 o^t+n(k),代表执行该候选动作块后构想出的视觉状态。随后,价值模型(Value Model)对这些构想出的未来状态进行打分,WLA 进而执行预测价值最高的那组动作块。这使得 WLA 能够事先在想象空间中拒绝潜在失败的轨迹,以免其影响真实环境。通过将预测的未来帧自回归地用作下一个输入,可以扩展想象的时程。
价值模型是使用微调后的 WLA-0 的 Rollout 轨迹训练的。每个 Rollout 包含任务指令 l、一系列世界专家预测的未来帧 {o^in}i=1⌊T/n⌋ 以及一个二元成功指示符 y∈{0,1},其中 T 为 Episode 长度。对于时间步 t 预测的未来帧,我们将其折扣价值标签指定为 vt=y⋅γT−t,其中 γ<1 为折扣因子。
实验
这一章的核心目的不在于展示具体数据,而是通过不同维度的实验来验证第 3 章所提出的 WLA 框架设计的合理性、各个关键模块的作用以及部署可行性。
实验验证的核心假设 (Core Research Questions)
第四章主要围绕以下几个关于 WLA 框架设计的核心问题展开验证:
- 双流表示的有效性:同时预测“高层文本意图”与“底层物理动态”,能否比传统 WAMs(纯视觉状态)和 VLAs(无高层意图指导)更好地处理复杂与长时程任务?
- 隐式世界建模的可行性:训练阶段用世界专家(World Expert)约束隐动作(Latent Action),推理阶段完全卸载世界专家,是否能在不损失控制特性的同时实现极低延迟?
- 测试时扩展(TTS)机制:在算力充足时,通过“想象未来帧 + 价值模型打分”的生成-筛选机制,能否有效提高复杂/分布外(OOD)场景的成功率?
- 无标注数据利用:框架能否直接利用无动作标注的跨具身(Cross-embodiment)视频学习物理动态转移?
评估维度与测试设置 (Evaluation Dimensions)
本章建立了多维度的评估体系,用于检验框架在不同场景下的能力:
仿真基准测试 (Simulation Benchmarks):
基础操控与泛化:测试模型在标准机械臂操控任务以及未见过的指令/环境(OOD)下的泛化表现。
长时程记忆任务 (如 RMBench):评估利用文本意图进行高层子任务拆解、历史记忆缓冲区(Memory Buffer M)维护以及错误纠正的能力。
真实世界机器人评估 (Real-World Evaluation):
动态与抗干扰场景:测试在环境动态变化、存在物理干预等不确定性下的鲁棒性。
高实时性控制 (如“叠杯子”):验证单次推理 40ms 的极低延迟在对时间敏感的闭环控制任务中的优势。
无动作标注学习 (Unlabeled Data Learning):
验证仅通过第一视角视频监督学习物理动态转移(ht→ot+n)是否能反哺并增强动作预测能力。
关键消融实验与框架设计验证 (Key Architecture Ablations)
第四章通过消融实验(Ablation Studies)证明了 WLA 论文中多项核心架构决定的正确性:
- 辅助世界建模损失 (Lwm) 的必要性:
- 移除世界建模损失后,动作预测的成功率出现大幅下降。这证明了让主干网络学习物理动态转移(隐动作)能提供强有力的物理先验。
- 预测目标帧 (ot+n) vs 预测完整视频剪辑 (ot:t+n):
- 实验表明,世界专家仅预测未来第 t+n 步的静态目标帧,在控制性能上与预测完整视频剪辑相当甚至更优,同时大幅降低了训练和表示复杂度。
- 推理期卸载世界专家的有效性:
- 实验证实,在推理时将世界专家完全丢弃,不会损害动作输出的质量。这验证了“世界模型的作用是通过参数梯度将物理觉察能力赋予主干网络,而非必须在推理时显式渲染图像”这一核心观点。
- 测试时扩展 (TTS) 的价值模型筛选机制:
- 在高难度/长时程任务中,开启 TTS 模式(采样多个动作候选 → 预测未来帧 → 价值模型打分)可以有效剔除会导致潜在失败的动作,显著提升整体任务完成率。
框架学习总结与 Takeaways
- 职责分离(Decoupling):WLA 将“繁重的像素级渲染细节”转移给轻量级扩散模型(世界专家),主干网络仅专注于预测紧凑的“高层语义意图 + 关键物理动态转移(元查询/隐动作)”,避免了自回归模型陷于底层像素的沉重负担。
- “训练期导师”模式:世界专家充当训练阶段的约束工具,在部署阶段无需显式生成未来图像,从而兼顾了强物理觉察与实时的控制延迟(~40ms)。
- 灵活的推理模式:框架设计具备弹性:在边端实时控制时使用高效模式(纯自回归推理),在云端/复杂决策场景下可开启 TTS 模式(想象-打分-决策)。
总结以及局限性
WLA 是一个集成了世界建模、语言推理和动作合成的统一具身框架。采用自回归语言主干网络,并结合世界专家(World Expert)与动作专家(Action Expert),对语义层面的文本子任务和细粒度的物理动态进行建模,从而实现了高效的长程推理与实时机器人控制
此外,它具备直接从无动作标注的视频中学习新任务的能力,为实现可扩展的跨具身机器人学习展现出了富有前景的方向。
尽管取得了令人鼓舞的成果,WLA 仍存在若干局限性:
- 真实场景评估有限:目前真实世界的实验仅限于单一机器人平台上的少量双臂任务;需要在更多样化的具身形态和任务领域开展更广泛的评估,以进一步验证其通用性。
- 视频监督依赖仿真数据:此外,我们基于视频的任务学习实验目前仍依赖于仿真机器人视频来进行监督。