在8月27日举行的“TIME|时间”物理 AI 暨第二代 VLA 全新版本体验日中,小鹏集团披露第二代 VLA 模型的首次重大升级,小鹏通用智能中心负责人刘先明提到,“模型理解物理世界,既要看见当下,也要记住过去、预判未来”。
伴随模型的重大升级,近期小鹏基座模型团队也正式发布 XCoT 技术报告,完整披露“可执行思维链”(Executable Chain-of-Thought,XCoT)这一面向物理 AI 的推理范式。这项技术以自动驾驶为验证场景,回答的却是一个更大的问题:当 AI 从数字世界走向物理世界,当模型从理解空间升级到理解时空,无论它是一辆车、一个机器人,还是任何需要实时思考的智能体,模型对未来的想象需要到达什么程度?思考能力要以什么形态存在,才能想得清楚、又来得及行动?
论文链接:https://arxiv.org/pdf/2608.10976
物理 AI 的难题:
克服思考过程的时间差
要理解 XCoT 的价值,先要理解它所针对的困境。
近年来,视觉-语言-动作模型被寄望于打通物理智能的三个环节:场景理解、语义推理、动作生成。传统的思维链技术让模型学会了“先想后答”,在复杂交互、多方博弈的场景中展现出接近人类的判断潜力。但这份思考能力在进入本体时遇到了一堵墙:自然语言思维链是开放式的、解码昂贵的,而且作为一种面向动作的表示,它存在时间差。
那么,面对的一个难题是:如果保留推理,一段冗长的、几十个 token 的自然语言解释,其自回归解码开销又很难适应毫秒必争的实时控制。汽车需要在复杂交通中判断何时减速、避让和变道;机器人需要在开放的环境中理解任务、识别人类意图,并在抓取、行走、递送与协作之间不断作出选择。它们都需要推理,但这种推理不能成为行动的负担。
行业里的多数方案在这两端之间摇摆:要么会思考但来不及,要么来得及但不思考。
因此,XCoT 探索的不是“模型是否需要思考”,而是“模型应该用什么方式思考”。
让思考直达行动
传统思维链让模型“说出”自己的推理过程,但自然语言是给人看的——它开放、冗长、难以约束。更关键的是,语言描述与车辆动作之间始终隔着一层翻译:模型说“前方有行人,应该减速让行”,这句话还需要被解析、映射、再转成控制量,每一层转换都是损耗和延迟。
XCoT 选择缩短这条链路:模型不再花费大量 token 来描述未来,而是生成少量结构化的决策标记参与行动生成。模型生成的 XCoT 标记都储存在动作空间里,负责轨迹推理的 Control FFN 可以通过共享的多模态自注意力直接读取和执行,中间没有任何翻译工作。换言之,XCoT 不做过多的解释工作,而是将对场景的判断压缩成后续动作模块能够直接利用的结构化信息,一定程度上影响最终的控制信号,具备能参与行动生成的思考能力。
而要让模型学会这种“可执行的思考”,最大的难题是监督数据从哪里来。人类不会在行动时逐帧标注自己的决策依据。于是,小鹏基座模型团队构建了自动化的“推理—动作”(Reason-Action)监督数据:真实行驶轨迹提供动作证据,场景上下文提供因果语义,二者对齐后,模型便学会了在正确的场景里做出正确的决定。据报告披露,最终用于训练的混合监督数据总量达到 362 万条。模型从中学到的不是如何措辞,而是如何决断。
XCoT 数据构建路径
这套数据构建的方法也是可迁移的,对于任何拥有大规模真实行为数据的物理 AI 本体而言,都可以复用这一条数据构建路径。当然,迁移至新本体时,仍需针对任务空间、动作词表和本体能力重新设计与训练,但其基本方法具有跨本体复用的潜力。
方向感在前,想象力在后
如果模型对于未来的想象力是无限的,它在规划时就需要有约束,这样一来,想象的内容才是可落地的。
面对下一秒发生的情况,一个物理 AI 本体可以做出不同的动作应对。XCoT 做的第一件事是收敛:将无限的可能性收束成一个明确的方向,例如减速、保持或向左。随后,Flow Matching 循着这个方向做发散,给出多条具体的做法——快一点的、缓一点的、更贴近人类习惯的,等等。没有第一步的收敛,发散就会变成漫无目的的枚举。
就像夜间行车的车灯:灯光不可能照亮全部黑暗,而是先照亮一个方向,再在这片光里看清每一条可走的路。
架构上,这一分工由确定性的标记-功能路由实现:所有非轨迹标记(视觉、文本、任务提示、本体状态)以及自回归生成的 XCoT 标记,统一交给 Reason FFN 加工决策语义;24 个固定的轨迹查询位置交给 Control FFN 进行轨迹计算。两个分支通过共享的多模态自注意力交换信息,使轨迹查询能够利用 XCoT 所承载的决策信息。这种解耦的价值在于,模型可以在强化决策推理能力的同时,尽可能减少对既有轨迹控制能力的干扰。
消融实验证明这种解耦式的设计对横向决策尤为有效:变道场景横向 FDE 从 1.616 降至 0.648,误差降低近六成。变道恰恰是那类“意图先行”的举动——决定要不要做,远比算出怎么做更难。而机器人日常面对的抓取、避让、协作,几乎也属于这一类。这都是“方向感”价值最直接的体现。
在效率上,报告以 12 Hz 规划频率对应的约 83.3 毫秒作为时延预算,在 H100 GPU 上实测每 token 解码时延约 3.25 毫秒——由于 XCoT 序列仅需 2 至 6 个标记,即使按最坏情况估算,推理接口开销也低于预算。
XCoT 整体架构概览
这种架构也提供了一种跨本体想象:决策能力与动作能力不必完全捆绑。不同本体拥有不同的机械结构、运动方式和执行边界,但它们可能共享一部分场景理解、任务推理和决策生成能力。换一双手脚,不一定重新创造一颗大脑。
XCPO:在明确意图上持续优化
如何稳定地输出更优的决策,是本项技术的另一项重要探索。就如同,新手司机在变道时会小心谨慎,甚至犹犹豫豫,当 TA 开得多了,成长为老司机的时候,也能完成高效、丝滑的变道。
XCoT 生成的多条候选轨迹共享同一个决策方向,也再一次证明:多样性不是随机性,而是长在明确的意图之上的。在同一个可执行标记空间之上,团队进一步提出了 XCoT 策略优化(XCoT Policy Optimization, XCPO)。其思路是:尽量保持既有动作能力稳定,重点优化模型如何作出更好的决策。模型尝试不同的决策标记组合,用生成轨迹的安全性、舒适性、合规性与效率作为奖励函数,回过头修正决策本身——训练本体在脑中做出更好的判断。
XCPO 运作机制
这套机制的重要性在于,紧凑、离散的 XCoT 标记,使“推理”这件事本身也成为能被优化的对象。与冗长、开放的自然语言思维链相比,它更容易定义边界,也更容易与行动结果建立反馈关系。
先收敛,再发散,最后让结果反哺判断。有约束力的想象反哺方向感,未来在模型内部形成了一个完整的学习闭环。
为 Robot 铺好的那条路
将 XCoT 放进小鹏物理 AI 技术图谱,它的位置会更加清晰。
小鹏物理世界基座模型,以第二代 VLA 与世界模型为两大支柱。这套基座之上生长着自动驾驶、 Robotaxi、机器人等多个本体——小鹏从一开始就是在用做机器人的方式做自动驾驶:自动驾驶是物理 AI 严苛的考场,它用真实道路的复杂性、实时性,逼出了推理范式最紧凑、最可执行的形态。XCoT 在自动驾驶的考场上完成验证的成果,所沉淀下来的可执行标记空间、推理与控制的解耦架构、推理监督方式、决策层的策略优化不是为某一种本体定制的,而是基座模型层面的公共资产。
面向下一阶段,XCoT 可能会成为一个跨本体持续生长的接口:驾驶的决策词表覆盖车流中的博弈,机器人的决策词表覆盖抓取、避让与人机协作,而它们共享同一套推理机制。XCPO 与世界模型仿真结合,也会让每一个本体都能在大规模虚拟历练中不断打磨判断力,变成下一次决策的养分。
One Infra, Two Products
or Multiple Products
小鹏在基座模型方面的探索,也正在向机器人等更多本体落地。随着小鹏 IRON 的量产节点临近,这些基座模型层面的探索正在获得更加现实的意义。
9月8日,小鹏机器人生产线正式启用,全球首位高阶通用人形机器人完成自动化总装并自主走下产线亮相,标志着小鹏机器人完成从研发试制到产线制造的关键跨越,向规模量产迈出重要一步。
这意味着“让思考在本体上实时发生”也将变成大规模走进现实的工程命题。一台在门店里接待顾客的机器人,每一次驻足、转身、递送,背后都伴随着紧凑而准确的判断。XCoT 并不意味着某一套具体的技术方案已经部署到了机器人上,但它在研究层面给出了一条值得延展的路径:将推理压缩成面向行动的结构化接口,让高层决策能够在有限时延内进入动作生成,并通过行动结果持续优化判断。至少也证明了一件事:面向物理 AI 动作执行的推理可以是紧凑的、与轨迹生成直接相连的。这个模型的未来不是被一次性预测出来的,而是先被决定、再被想象、最后被选择。
从一套物理 AI 模型,到不同智能本体,再到规模化制造,小鹏正在逐步打通从模型底座、产品研发到产业化落地的完整链路,让 AI 突破单一产品的边界,走向更加广阔的物理世界。



沪公网安备31010702008139