JavaScript is required

小鹏集团发布 TuringViT:打造物理 AI 统一感知底座 重构视觉大模型训练范式

  • 今年上半年,小鹏集团密集发布物理AI技术报告,继多视角生成式世界模型 X-World、世界模型推理加速引擎 X-Cache、预测式世界模型 X-Foresight 及 X-Mind 技术框架之后,近日,小鹏正式发布 TuringViT 高效视觉编码器,面向 VLM/VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。

  • TuringViT 将全面支撑智能驾驶、智能座舱、IRON 人形机器人三大业务场景,同时为行业提供了一条可复现、低成本训练 SOTA 级(State-of-the-Art,最新技术水平)视觉 Transformer 的技术路径,推动先进视觉大模型从 “头部团队专属” 走向 “行业普惠”。

  • TuringViT 相关链接:官网:https://turingvit.github.io/论文:https://arxiv.org/abs/2606.24253

图片

零样本性能、训练数据规模以及 vision transformer 编码器的 1K 分辨率吞吐量。TuringViT 仅使用 10% 的训练数据,就实现了比领先的开源基线模型更强的准确性与效率权衡。

视觉编码器

物理 AI 规模化落地的核心瓶颈

如果说世界模型承载了物理 AI 对环境规律的认知与推演,那么视觉编码器就是物理 AI 的 “感知入口”——所有场景理解、状态判断、动作决策的第一步,都始于高质量的视觉特征提取。

随着 VLM 与 VLA 技术快速向真实场景落地,行业对视觉编码器的要求正在发生本质变化:高分辨率图像、多视角输入、连续视频帧成为常态,端侧部署对延迟与算力有严苛约束,不同业务场景需要定制化的视觉能力适配。而当前主流技术路线正面临三重普遍瓶颈:

  • 算力成本瓶颈:标准 softmax 注意力的计算复杂度随视觉 token 数量呈二次方增长,高分辨率、多帧视频场景下训练与推理成本急剧上升,难以落地端侧实时场景;

  • 数据效率瓶颈:主流高性能 ViT 依赖百亿级海量图文数据训练,但网络数据噪声大、标注对齐度低,单纯堆数据规模带来的收益边际递减,中小团队难以复刻 SOTA 效果;

  • 场景适配瓶颈:多数视觉模型采用固定分辨率预训练,与下游 VLM/VLA 的动态分辨率、多变长宽比输入需求存在天然不匹配,事后适配不仅增加研发成本,还会带来性能损耗。

行业普遍采用的 “复用开源通用 ViT” 方案,已难以匹配智能驾驶、具身机器人等真实场景对性能、延迟与定制化的综合需求。TuringViT 正是小鹏针对这一行业痛点给出的系统性解决方案。

三大核心创新

重构视觉大模型训练范式

TuringViT 从架构、数据、训练三个维度同步突破,打造了 “线性注意力主导 + 高质量数据治理 + 原生动态分辨率” 的完整技术体系,实现了效果、效率与落地性的三重提升。

Turing 线性注意力:高分辨率场景实现近线性延迟缩放

针对 softmax 注意力在长序列下的算力困境,TuringViT 创新性地提出 Turing 线性注意力(TLA)作为核心计算单元,构建 “5 层线性注意力 + 1 层标准多头注意力” 的混合 Turing Block 架构。

该设计让线性注意力承担主要的全局上下文聚合工作,将计算复杂度从二次方降至近线性;仅周期性插入少量标准注意力层保障 token 级交互精度,同时搭配序列长度感知归一化与输入依赖门控机制,在高效全局建模的同时保留局部细节与高频视觉特征,避免线性注意力常见的细节平滑问题。

图片

TuringViT 的块架构和模型配置。

(左)主干建立在重复的图灵块,图灵线性注意力(TLA)聚合全局上下文;其序列长度感知归一化和输入依赖的输出门可稳定可变标记训练并保持高频局部细节。

(右)TuringViT-18L 和 TuringViT-24L 的模型配置,在共享相同补丁大小(16×16)的同时,采用 2D RoPE,以块和总层数为尺度,嵌入/头部维度,以及多层感知器(MLP)比例。

TuringViT 共推出两个规格版本:TuringViT-18L 包含 3 组 Turing Block(共 15 层 TLA+3 层 MHA),主打动态分辨率下的高效部署;TuringViT-24L 包含 4 组 Turing Block(共 20 层 TLA+4 层 MHA),在保持线性计算主导的前提下进一步提升表征能力。

实测数据显示,随着输入分辨率提升,TuringViT 的延迟增长曲线远平缓于标准 softmax ViT,高分辨率下的效率优势愈发显著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。

VISTA-Curation 数据治理:10% 数据量实现 SOTA 级效果

不同于行业 “堆数据规模” 的粗放路线,TuringViT 打造了 VISTA-Curation 多模态数据治理流水线,通过提升单样本的监督价值实现数据效率的量级提升,从 “用更多数据” 转向 “用更优质的监督”。

针对图文数据,流水线通过三步精细化筛选实现质量升级:第一步过滤低分辨率、模糊、低纹理的低质量图片;第二步通过多模型、多提示词生成多样化候选字幕,并交叉验证视觉一致性;第三步在统一对比池中通过相对图文对齐度、文本信息量、歧义度综合打分,筛选出视觉贴合度高、语义信息密度高的优质标注,淘汰模糊、泛化、弱对齐的样本。

图片

图像-文本筛选及处理流程

针对视频数据,流水线同样进行全流程治理:先将长视频切分为连续短片段并均匀采样代表帧;再通过语义一致性与运动一致性双重过滤,保留语义连贯、变化信息有效的片段;最后融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型从连续画面中学习更鲁棒的视觉表征。

图片

视频-语义筛选及处理流程

最终,TuringViT 仅用 0.85B 图文对(约为 SigLIP2-L 训练数据规模的 10%),便在 ImageNet-1K 等六项零样本分类基准上取得 83.6% 的平均准确率,超越使用 10B 数据训练的主流开源基线;在 COCO、Flickr30K 图文检索任务上同样优势显著,真正实现了 “十分之一数据,更优效果” 的突破。缩放律分析进一步显示,模型性能仍远未饱和,随高质量数据规模扩大将持续可预测地提升。

原生动态分辨率训练:从预训练阶段对齐下游需求

TuringViT 采用四阶段渐进式原生动态分辨率训练范式,从预训练之初就适配下游 VLM/VLA 的输入特性,彻底告别 “固定分辨率预训练 + 事后适配” 的传统模式。

四个阶段循序渐进,逐步对齐下游真实场景:

  1. 视觉初始化阶段:通过掩码图像建模(MIM)蒸馏 EVA02-CLIP-E 特征,完成视觉基础表征学习,强化几何细节与高频信息保留能力;

  2. 范围受限动态分辨率训练:保留图像原始长宽比,将长边约束在 256-512 区间,在可控成本下让模型提前适应可变长度视觉 token 序列;

  3. 原生分辨率精调:放开分辨率约束,尽可能保留图像原始尺寸与比例,让视觉预处理与下游 VLM 使用方式完全一致;

  4. 图文视频混合训练:加入经过治理的视频数据,将静态图像表征拓展为具备变换感知能力的图像 - 视频统一表征,提升下游任务迁移性。

配合 Dinov3 风格的二维旋转位置编码(2D RoPE),模型天然支持不同尺寸与长宽比的输入,无需额外插值或持续训练适配。这种 “VLM 原生” 的设计让视觉预训练与下游多模态任务无缝衔接,大幅降低集成适配成本。在统一 VLM 训练流水线的对比测试中,搭载 TuringViT 的多模态模型在目标定位、计数、OCR 识别、文档理解、通用视觉问答等多数任务上均优于搭载 SigLIP2 与 MobileCLIP2 的基线方案。

全场景统一底座

筑牢物理 AI 技术闭环

随着 TuringViT 的发布,小鹏全栈自研的物理 AI 底层技术能力逐步完善和丰富。小鹏的物理 AI 底层技术能力,也不仅仅服务于智能辅助驾驶,更将赋能更多物理 AI 业务场景。

赋能第二代 VLA:让高分辨率感知真正落地车端

在智能驾驶领域,TuringViT 是第二代 VLA 模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供低延迟、高质量的视觉 token。

其近线性的延迟特性,让高分辨率视觉感知得以在车端算力约束下稳定运行,助力窄路通行、无导航辅助驾驶、复杂路口处理、长尾交通参与者识别等功能的体验升级;进一步释放端侧大模型的性能潜力,让驾驶决策既 “看得清” 又 “反应快”。

升级座舱交互:实现视觉与语言的自然融合

面向智能座舱与驾泊一体化场景,TuringViT 的 VLM 原生特性让视觉特征与语言模型实现更高效的对齐,可以提供更高的识别精度、不同画幅和比例的视觉输入,以支撑更多未来的车辆与用户交互的丰富座舱功能。

夯实具身基础:为 IRON 机器人打造通用视觉能力

在小鹏 IRON 人形机器人的技术体系中,TuringViT 充当着 “视觉视网膜” 的核心角色,为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。

统一的基座架构让智能驾驶场景积累的海量视觉经验能够快速迁移到机器人场景,大幅降低跨场景研发成本;高效的端侧部署特性也适配机器人的嵌入式算力约束,加速展厅导览、工业巡检、商业服务等场景的落地进程。

开放技术路径 推动视觉大模型行业普惠

TuringViT 的价值不止于小鹏内部业务的落地,更在于为行业提供了一套可复现、可迁移的 SOTA 级视觉大模型训练方法论。其核心架构设计、数据治理流程与训练范式均不依赖特定硬件平台,能够适配不同算力环境,通过可复现的数据治理、训练与部署流程,TuringViT 有望降低高性能视觉编码器的训练与定制门槛,使更多团队能够在可控算力条件下构建面向自身业务的视觉基础模型。

未来,小鹏将持续扩大高质量图文视频数据规模,深化时序建模与具身视觉方向的技术探索,推动视觉基座与 VLM/VLA 系统的更深度融合,让先进 AI 技术真正渗透到每一次出行、每一个交互场景,以科技突破定义智能出行与具身智能的新高度。

附:小鹏物理 AI 基座模型相关论文

X-World

论文:https://arxiv.org/pdf/2603.19979

官网:https://x-world-1.github.io/

X-Cache

论文:https://arxiv.org/abs/2604.20289

官网:https://x-cache-1.github.io/en/

X-Foresight

论文:https://arxiv.org/abs/2605.24892

官网:https://x-foresight-1.github.io/en/

X-Mind

论文:https://arxiv.org/abs/2606.28758

官网:https://xp-x-mind.github.io/en/

点击查看全文
评论赞0分享
轨迹
物理AI小鹏汽车

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4