当机器人先想后动:DreamZero 与 DreamDojo 的分层协作为何重要

DreamZero 把动作作为输出目标,DreamDojo 把动作作为条件输入。二者的分层协同,为具身智能提供了一条“先预演、再执行”的技术路线。

具身智能领域,如何让机器人“想清楚再动手”正成为新的技术焦点。近期围绕 DreamZeroDreamDojo 的讨论,展示了两种不同但互补的模型路线:前者把动作作为输出目标,直接驱动机器人;后者把动作作为条件输入,预测行为后果。两者并非彼此替代,而是可能构成一套“上层决策 + 下层模拟”的分层系统。

这一思路的关键,在于把“决策”和“动力学预测”拆开:DreamZero 负责提出候选动作,DreamDojo 负责预演这些动作可能带来的结果,再由上层 Agent 或评估模块进行筛选和修正。相比传统“观测到动作”的单跳控制方式,这种分工更接近人类在行动前进行内部推演的过程。

动作是输出还是输入:两条路线的根本差异

DreamZero 与 DreamDojo 最核心的差异,并不是模型大小或训练数据,而是“动作”在网络中的角色。

DreamZero 属于 World Action Model(WAM)路线,其思路是让视频与动作在同一个注意力空间中联合学习。以阿里和 NVIDIA GEAR Lab 提出的版本为例,它以预训练视频扩散模型 Wan2.1-I2V-14B-480P 为骨干,输入包括多视角图像、机器人本体状态和自然语言指令,输出则是 24 步动作序列和未来视频帧。其核心创新之一,是在视频 DiT 的 token 序列末尾附加 action/state token,让视频块可以看见当前动作,动作块也可以理解当前画面,从而把“世界如何被动作改变”和“动作如何生成”放进同一个训练目标中。

DreamDojo 则走的是另一条路。它更接近动作条件化的潜动作世界模型,重点是预测“如果执行某个动作,世界接下来会怎样变化”。在这类模型中,动作不是被预测的目标,而是进入网络的条件信息。通过类似 32 维信息瓶颈的设计,模型在重建未来视频的过程中被迫提取帧与帧之间的运动信息,从而形成“潜动作”表示。这使得世界模型可以在大量无标注视频上预训练,再逐步对齐真实机器人动力学。

这种差异也带来了一个现实问题:同一个训练目标很难同时优化两个模块。对 DreamZero 来说,动作是可微的输出;而在 DreamDojo 中,动作往往作为不可微条件存在。因此,二者无法简单合并成一个端到端模型,反而更适合以系统层协同的方式组合。

分工的价值:数据、模块与决策归因

把 DreamZero 与 DreamDojo 放在一起观察,可以看到一种更清晰的工程逻辑:让不同模型分别学习不同知识。

  • 数据解耦:DreamDojo 可以利用海量无标注人类视频学习世界运动规律,DreamZero 则更适合在相对少但高质量的机器人动作标注数据上进行微调。
  • 模块解耦:世界模型升级更大的视频骨干或更丰富的数据时,不必重训策略模型;策略模型更换调度方式或微调结构,也不必重训世界模型。
  • 决策归因更清晰:如果一次抓取失败,系统可以更容易地区分是候选动作提出有问题,还是世界模型预测有偏差,或是低层动作细节需要修正。

这也是两者协同的重要价值所在。过去许多视觉-语言-动作模型(VLA)直接从观测映射到动作,面对未见过的场景时容易失效。而 DreamZero 与 DreamDojo 的组合,则更接近一种“提出—预演—验证—执行”的流程:DreamZero 生成候选方案,DreamDojo 想象每种方案的未来状态,上层 Agent 再依据结果进行排序、筛选或重新规划。

按照相关访谈中的设想,在实际应用中,DreamZero 或 WAM 可以先对不同文本步骤进行预测,选出较优方案;确定子任务后,再把更低层的动作轨迹交给 DreamDojo,继续优化接近速度、抓取角度、力度等细节。这种分工对应的是一种“外环规划 + 内环修正”的结构:DreamZero 偏向上层决策,DreamDojo 偏向下层动力学优化。

从像素级想象到潜空间验证

不过,让机器人在执行前“预演”并非没有代价。完整生成未来视频虽然直观,但会带来推理时延和算力压力。对于需要闭环控制的机器人来说,延迟过高会直接影响实时性。

因此,业界正在出现的趋势是:世界模型不再只是训练阶段的辅助工具,而是在推理阶段参与动作修正;同时,这种参与未必一定要以像素级视频生成的方式完成。Fast-WAM 等工作提示,在潜空间中进行轻量验证,可能比完整渲染未来画面更适合实时控制。ω-EVA、VLA-JEPA 等路线也提供了类似的思路:把“想象”压缩到潜空间中,而不是每次都生成清晰图像。

从这个角度看,DreamZero、DreamDojo 以及其他相关方案并不是彼此割裂的路线,而是处在同一条演化路径上的不同实现方式:DreamZero 偏向像素级联合生成,DreamDojo 在像素空间预训练后可通过蒸馏压缩部署,ω-EVA 等方案则更强调潜空间内的提案与验算。未来更成熟的系统,可能会同时使用多种粒度:外层用跨模型管线做长时域评估和重规划,内层用单模型内闭环做快速修正。

对具身智能的启示:先想后动,但要想得更快

DreamZero 与 DreamDojo 的对比,最终指向的是具身智能系统架构的一个关键转变:从单模型直接输出动作,转向多模型协同下的分层控制。

这种结构的优势在于,它把机器人面对复杂环境时的两类能力分开训练和调用。一类是策略能力,即在具体任务中应该采取什么动作;另一类是动力学能力,即理解动作执行后世界会如何变化。前者依赖高质量动作示范,后者可以从更广泛的视频数据中学习。两者结合后,机器人在面对新场景时,不只是被动复现训练过的动作,而是可以先评估不同选择的后果,再选择较优路径。

当然,这种协同仍面临工程挑战,包括时延叠加、误差累积、失败归因复杂,以及从仿真到真机的动作语义一致性问题。接下来更值得关注的,不是某一个模型是否足够强大,而是这套分层系统能否在实时性、稳定性和可评估性上达到工程落地要求。

如果这一方向继续推进,未来的机器人系统可能不会是一个巨大的端到端模型,而更像是一套分工明确的协作网络:上层模型负责任务拆解和方案选择,中层模型负责预测后果,下层模型负责精细动作修正。DreamZero 与 DreamDojo 的组合,正是这种“先想后动”范式的一次具体展开。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/dang-ji-qi-ren-xian-xiang-hou-dong-dreamzero-yu-dreamdojo

Like (0)
点点的头像点点
Previous 7小时前
Next 5小时前

相关推荐