2026 年 7 月,来自比亚迪汽车新技术研究院的作者发布了 HyWorldVLA。论文的目的是把两类世界模型中互补的训练信号放进同一个驾驶 VLA中,提升在雨雾天气中的驾驶表现。接下来我们就一起看一下 HyWorldVLA到底是如何做到的。
01.
自动驾驶需要"想象力"
和AI不同,人类驾驶员开车有个天然的习惯,即预判,也可以理解为“想象力”。比如"前面那辆车可能会变道"、"再过两秒要进路口了"。目前AI在重点解决的就是这种"想象未来"的能力,也就是预测未来几秒中发生的事情。
目前关于怎么“想象未来”,主要有两种流派。一是像素派(Pixel-based),另外一种是隐式潜在派(Latent-based)。
以 DriveVLA-W0 等为代表,Pixel-based理念是将未来发生的事情用每一帧画面生成出来,每个像素都要对应。也就是将未来帧通过 VQGAN 等 tokenizer 离散化为视觉 token,模型通过交叉熵损失学习预测这些 token。由于 token 携带密集的视觉信息,训练约束较强。该方向好处是可以提供密集的空间和动态训练约束,也就是可能保留车道线、车辆运动和遮挡关系等诸多细节。相应的缺点也很明显,雨雾、光照或模糊等表观变化会使这类预测更不稳定。
Latent-based理念有点相反。不需要每一帧的画面,而是只在“脑子”里记一句话:"前面有辆车在减速,我该刹车"。把画面压缩成一堆抽象的"概念"。好处是在紧凑特征空间里就可以预测未来状态,减少对低层表观噪声的敏感性,比如雨、雾天气等。缺点是 缺少视觉监督时,latent 可能难以保留细粒度时空信息,比如红绿灯信息。
简单总结就是,Pixel-based细节多,但怕噪声干扰。Latent-based虽然抗干扰能力强,但细节不够。好似硬币的两面。
02.
HyWorldVLA 的解法:“训练时双修,考试时单用”
对于这个看似矛盾的难题,HyWorldVLA的解法是把训练信号与推理接口进行分工。
在预训练阶段,将视觉token、动作、语言与未来 latent 一起预测。而在共微调阶段,则撤去视觉token 损失,保留动作目标与 latent 对齐。
做个简单的比喻,训练时既考“未来画面是否合理”,也考“未来状态是否对得上”;规划时不再要求生成画面,而用预测状态辅助做轨迹决策。
为什么这么做?这就涉及到要看它解决的两个具体问题:
问题一:纯 latent 预测容易"表征退化"。如果模型只被训练去预测一个抽象的潜在向量,没有足够丰富的监督信号,latent 学到的可能只是空洞的统计规律,丢掉了车道线在哪、前车在加速还是减速这类对驾驶至关重要的信息。
问题二:视觉 token 预测对表观噪声敏感。反过来,如果模型被训练去精确预测未来画面的每个视觉 token,雨雾、光照变化会让这个目标变得极其困难——模型被迫去拟合噪声,反而带偏了真正有用的场景理解。
HyWorldVLA 的做法恰好利用了这两个问题的互补性——用问题一的"解"去治问题二的"病",反过来也一样:
在预训练阶段,采用双信号互为约束:视觉 token 的交叉熵提供了一个高带宽的结构化监督。模型必须理解场景的几何布局和物体运动,才能预测"下一帧是什么"。这种密集的视觉约束像一位严格的教练,迫使 backbone 学到的 latent 表征不能偷懒、不能空洞。与此同时,VAE latent 的 MSE 目标为这个表征提供了一个更紧凑、更平滑的连续空间。它不要求逐 token 精确匹配,而是要求"大致对得上",天然对表观扰动更宽容。两个信号一紧一松、一密一疏,共同把 latent 训练到既富含信息、又不过度敏感。
在共微调阶段撤去脆弱的视觉分支:视觉 token 预测是高带宽的,也是高风险的。画面越模糊,预测越困难,误差信号越混乱。此时视觉约束已经从"教练"变成了"干扰源"。HyWorldVLA 在这一阶段果断撤去视觉 token 损失,只保留动作目标与 latent 对齐。因为预训练阶段 latent 已经被视觉信号"喂饱"了,即使撤去视觉分支,latent 里仍然沉淀着丰富的场景理解。而 latent 本身作为压缩表示,对雨雾等表观变化天然更鲁棒,论文在 655 个雨雾案例上的结果支持这一判断。
打个比方:这就像先请一位严格的绘画老师(视觉 token CE)带学生反复临摹场景,把空间感、运动感刻进肌肉记忆;等到要上场比赛时,老师退场,学生凭内化的空间直觉做决策——不再需要画出完美画面,但决策质量反而更稳。
03.
怎么实现
HyWorldVLA可以分成三大组件。
组件一是文本引导的视频 VAE。
这是整个框架的"潜在空间基石"。输入视频段经过两级压缩:空间 8 倍下采样 + 时间 4 倍压缩,变成紧凑的潜在特征。关键创新是在每个 block 内嵌入文本交叉注意力,用 Flan-T5 的文本嵌入作为 key。实施细节中,这些文本是由 Qwen3.6-plus 为视频生成的短场景描述,而不是导航指令本身。 视频 VAE只在最开始独立训练一次。训练完成后就冻住了。此后预训练和共微调阶段,VAE 都不再更新参数。
组件二:VLM 骨干(基于 Emu3)
视觉、动作、语言三种信号被统一离散化进同一个词表:视觉用 VQGAN、动作用 FAST、语言用 Emu3 tokenizer。然后构造一个自回归序列,在序列里插入可学习的 query token,专门负责"问"未来会怎样,输出对未来潜在特征的预测。
VLM 骨干贯穿预训练和共微调,但训练目标在变。预训练阶段,它同时面对四项损失——语言、动作、视觉 token、潜在 MSE——像一个多任务学生。到了共微调阶段,视觉 token 和语言 CE 被撤去,只保留动作相关的目标(通过骨干的隐藏状态间接参与 L_action)和潜在 MSE。训练目标少了,但更聚焦。
组件三:动作专家(π₀ 式)
预测出的未来潜在特征,会显式喂给一个独立的动作专家模块。这个模块参考了 π₀ 的联合注意力机制,把历史动作、驾驶命令、预测潜在特征拼在一起,通过 Flow Matching 或选择型方式生成驾驶轨迹。
动作专家 只在共微调阶段登场,它不参与预训练。共微调时,动作专家接收组件二预测的未来潜在特征、历史动作和驾驶命令,通过联合注意力交互后输出轨迹,由 L_action 监督。
04.
实验结果:晴天够准,雨天够稳
在论文列出的NAVSIM v1 方法中,HyWorldVLA 的 90.59 为最高机器方法分数;同为单前视相机的 DriveVLA-W0 为 90.2。
在NAVSIM v2中,新增了行驶方向合规、交通信号灯合规、车道保持等维度。HyWorldVLA 为 89.71 EPDMS,比表内次高的 ExploreVLA(88.8)高 0.91 分。
当然重头戏还是 雨雾噪声评测。从 OpenScene 测试集收集了 655 个含雨雾非均匀噪声的案例,在这 655 个雨雾案例中,HyWorldVLA 为 86.87。它比表内最强的同架构消融“去共微调 latent 监督”(73.18)高 13.69;比外部像素基线中分数最高的 DriveLaW(67.49)高 19.38;比 DriveVLA-W0(61.18)高 25.69。
其他方面。在光照变化中,从晴天到阴天系统性调节前视光照,DriveVLA-W0 出现明显行为异常(右转指令下直行),HyWorldVLA 基本不变。在雨雾模糊情况下,交通灯和车辆部分遮挡的条件下,DriveVLA-W0 红灯排队时爬行、因模糊图像过度减速;HyWorldVLA 保持红灯静止、维持合理速度。
04.
相似路线
HyWorldVLA 的“混合路线”并非凭空出现。其理念在2018年论文PlaNet中就已提出,其核心理念是从像素观测学习 latent dynamics,并在 latent 空间做在线规划,是该类路线的重要早期代表。 此后Dreamer继续优化。最近与之相似理念的是4月小米发布的OneVL论文,其主张用语言CoT + 视觉未来 token 双辅助监督 latent,推理时丢弃。
不过对比来看,虽然 HyWorldVLA和 OneVL 两者都信奉"辅助未来预测监督喂饱潜在、推理时丢弃辅助"。但实现上有本质区别。小米视觉监督用的是离散 token(CE 损失),不是真实像素。比亚迪则采用视觉 token(CE 损失)+ 独立 Video VAE 的视频重建训练。另外在latent形式上两者已也区别。
总结.
由于只采用了单前视相机,在实际场景测试时依然存在诸多不足。比如将排队车辆误判为"低速移动"、左转时压双黄线等。但证实了训练信号与规划接口分工之后性能的提升。同时,也侧面反映了比亚迪在前沿技术方向上的投入、探索。
-END-



沪公网安备31010702008139