JavaScript is required

物理世界的「AI Coding时刻」,从它石智航的一条线束生产开始

2026年,没有人再争论AI能不能写代码。从辅助补全到接管整个工程任务,代码领域的“AI时刻”已经发生,它成了所有人评估AI进程的心理坐标。

于是一个自然的问题浮出水面:物理世界的“AI Coding时刻”,什么时候来?

7月17日,在2026世界人工智能大会(WAIC)主论坛「从虚拟到现实:世界模型如何驱动具身智能?」圆桌上,它石智航创始人兼CEO陈亦伦给出了他的答案。他认为“未来三年制造业将成为具身智能最重要的发展⽅向。制造业可以看作物理世界的Coding。中国的制造场景不仅拥有海量真实作业数据,也具备明确的评价标准和丰富多样的任务,是训练世界模型、验证物理AI能⼒的最佳实践环境。”

图片

从WAIC现场也能看出这个判断正在成为共识。

相比去年偏重展示模型能力本身,今年具身智能赛道明显把重心放在了场景落地上。不少企业选择把真实产线原样搬进展台,展示其真实落地情况。比如苏度科技和宁德时代合作的电池模组生产线、JAKA和华域电动合作的电机外壳装配、国地中心和延锋合作的喇叭套件装配等。

这些场景中,最引人注目的,是它石智航与天海电子合作的汽车线束装配线。

众所周知,汽车线束的装配是最难实现自动化操作的工序。正因如此,这条线束装配产线极有可能成为陈亦伦给出的那个“AI Coding时刻”的起点。

01.

他见过质变发生的那一刻

要理解这一切,得回到陈亦伦的上一段战场。

陈亦伦此前在交流中回忆过华为自动驾驶时期推动端到端的经历。当时业内的标准做法,是感知、融合、预测、决策、规划五层串联,每层由数百人的工程团队用规则代码堆砌。

这套机制一旦问题出了怎么办?

一层层往上“甩锅”,靠组织之间的博弈把问题传导回去。他形容那是一种“人肉反向传播”,而人肉传播是有上限的。

他选择的解法在当时近乎离经叛道:砍掉一半测试车队的常规任务,转去全量记录人类司机的真实驾驶数据,喂给端到端网络。

转折点出现在一个具体的数字上。数据积累到5000小时左右,模型输出发生了肉眼可见的变化;到9000小时,“它不是死记硬背,是真的学到了东西”。最终,一套只有约300行核心代码的端到端系统,替代了身后30万行的规则代码,在上海闹市一段人车混行、上百个动态目标的路段流畅通过。

那是传统方法公认搞不定的场景。

从这段经历里,陈亦伦提炼出一个后来反复出现在他表达中的判断:数据才是源代码,模型只是编译出来的结果。数据规模的断档,会直接带来产品能力的断代。

所以当他在2025年创办它石智航、进入具身智能领域时,第一个问题不是“用什么模型架构”,而是:数据从哪来,要多少。

02.

1000万小时:一道劝退大多数玩家的门槛

陈亦伦的推算方式很工程师:自动驾驶达到产品级交付,需要约100万小时的精华数据。

这是他亲手验证过的数字。

而具身智能要处理的任务复杂度,至少比自动驾驶高一个数量级,“自动驾驶可以看作它的一个子模型”。

由此得出门槛:约1000万小时的高质量真实数据。

他同时给出了边界,从1000万小时到1亿小时,边际效应递减,到那时瓶颈就不再是数据了。

拿这把尺子去量当前行业的三条数据路线,结论会变得很清晰。

遥操作。它真实、确实能work,但采集效率与机器人数量成正比,成本高企,永远到不了千万小时量级。陈亦伦的判断很直接:遥操作适合在单一任务上精雕的垂类小模型,但对具身大模型而言“是一条死胡同”。更致命的是,很多真实场景根本不允许这种采集方式。工业产线有严格节拍,你不能让一个动作迟滞的遥操作环节把整条线打乱。

视频数据。视觉能提供几何和语义信息,却拿不到力、接触、触觉——恰恰是操作类任务成败所系的物理信息。这就是“一碰就破”的根源:模型生成的世界在像素层面无懈可击,在物理层面不堪一击。对需要真实交互的机器人来说,缺失的那部分不是锦上添花,是地基。

Human-centric范式。也就是它石智航给出的答案,是从真实的人类生产实践中获取数据:人正常工作、生活,采集系统无感记录——对标的正是自动驾驶“人开车、车记录”的数据飞轮。这类数据不仅模态完整,还同时记录了动作与环境状态的持续变化,本质上是真实世界里“干活的数据”。

这条路线还有一个容易被低估的红利。人做任何熟练动作时都带着大量不经意的小动作——把钥匙插进锁孔,人不会像传统机器那样对准后直插,而是拉过去、贴着边、试探着进。这些“小脑反应”式的微动作,恰恰是人类技巧的蒸馏,会极大提升任务的最终鲁棒性。而遥操作数据里,恰恰没有这些。

现状是:它石已经迈过100万小时,也就是“自动驾驶级”的高质量真实数据规模,并计划在2026年底冲击千万小时级投入。按陈亦伦自己的标尺,这意味着从"子模型"量级向"完整模型"量级的跨越正在进行中。

03.

AWE 3.5:把数据判断做成一个闭环

数据的判断讲完了,这些数据被做成了什么?

答案是它石在本届WAIC主论坛上正式发布的新一代具身原生基座大模型AWE 3.5。

“原生”两个字本身就是路线表态。行业里大量玩家的做法,是把成熟的视觉语言模型拿来改造、外挂动作头;而AWE从架构起点就是为具身任务设计的。在陈亦伦的认知里,数据的分布和类型决定网络架构,具身数据是连续的sensor与action流,和离散的文本token在本质上不同,套用为语言而生的架构,天花板从一开始就被限定了。

围绕AWE 3.5,它石构建了一个方法论闭环:原生架构 + 双先验预训练 + 世界模型驱动后训练 + 持续数据反哺。官方对此的概括是,依托超百万小时human-centric真实数据及丰富的视触觉信息,首次实现具身原生模型的「预训练+后训练」完整范式。

拆开看,它和前文的数据判断严丝合缝:human-centric数据从真实生产实践中来,喂给原生架构完成预训练;世界模型在后训练阶段扮演“裁判”——不仅预测机器人下一步动作(Action),更预测动作执行后世界状态(State)如何演化,用动作与环境的因果关系校准模型行为;模型进入真实场景干活,产生的新数据再回流训练。

这条路线的成色,前代模型已经给出过一组可查证的数字。今年3月发布的AWE 3.0,通过全视角通感决策(OSD)让机器人在训练中从未见过的新视角下任务性能提升3倍、动作抖动降低超45%;搭载AWE 3.0的A1机器人,还拿下了中国具身智能在工业精密操作领域的首个吉尼斯世界纪录。3.5是在这个已验证的底座上,把"预训练+后训练"的范式补完整。

这也应证了陈亦伦的观点,真正的世界模型,不是一台越来越逼真的“视频生成器”,而是这个闭环里理解因果、校验行为的那一环。用陈亦伦在圆桌上的概括,世界模型理解世界,物理AI改变世界。只预测动作而不知道动作的结果,就无法保证机器人行为的可靠性。

值得一提的是,它石这次没有把模型停留在发布会PPT上。展台现场,AWE 3.5开放了模型可视化互动体验。观众可以走进世界模型构建的虚拟空间,亲眼看机器人大脑如何理解空间、推演物理规则、规划动作路径。对一个把"理解因果"作为核心主张的模型来说,把黑盒当众打开,本身就是一种表态。

在商业化路径上,这套模型对应的是它石从成立之日起坚持的“Foundational Model + App”:一手构建面向物理世界的原生基座模型,一手通过垂类应用进入真实产业现场,让AI在真实任务中被验证、被交付。

04.

展台即考场:三道题

大会首日,它石通用具身大模型AWE摘得WAIC SAIL之星,成为本届唯一获SAIL奖的具身智能基座模型。

不过对于观众来说,更有说服力的是展位上正在发生的事。这次它石把“可信赖”拆成了可看、可试、可验证的三道题。

第一道,泛化题。展台上由AWE驱动的A1机器人在连续完成手机装盒收纳、书包打包、细小螺丝分类等任务。这些演示的意义不在单项难度,而在于“没见过的场景也能干、换一个东西也能做”。

第二道,交付题。它石在自有展台1:1复刻了与天海电子合作的一条线束工厂环形流水线,多台A1机器人组成作业集群,在AWE 3.5赋能下协同完成柔性线束装配的关键环节;这一场景同时入选WAIC官方具身机器人展区「模登时代·伙伴之城」。展台之外,它石正与上海嘉定区政府及天海电子、安波福等龙头伙伴推进规模化验证,推动全国首个千台级工业具身智能机器人集群的落地部署。除天海电子外,近日它石机器人也已进入安波福产线。

图片

△ 它石机器人落地安波福产线

第三道,精细操作题。7月18日,搭载DexHand灵巧手的A1机器人与魔术大师邓男子完成了一场灵巧手魔术首秀,现场完成摊牌、洗牌、写字、拧魔方等动作。

表演是形式,内核是对通用执行末端、工具使用、节奏配合与动作稳定性的综合考验。

这背后连着陈亦伦的另一个坚定立场,他是触觉的坚定拥护者。

机器人与自动驾驶最大的区别在于前者是接触系统,“所有的失败都发生在最后一厘米”,视觉与触觉的结合,才构成完整的世界模型。

三道题连起来,正好是机器人落地的三个方向。能理解不同任务,才能干好活;能迁移到真实产线,才能真干活;能完成精准反馈,才能干细活。

05.

为什么是线束:不是场景选择,是制高点选择

在所有可选的落地场景里,线束装配大概是最不“性感”的一个。没有人形机器人端咖啡的画面感,没有家庭场景的想象空间。

NE时代智能体 ,赞27

但如果理解陈亦伦“制造业可以看作物理世界的Coding”这个类比,就会明白线束恰恰是他刻意选择的制高点。

汽车是全世界最拥抱自动化的行业,车身、涂装、总装早已高度自动化,但线束因为柔软、精密、非刚体的特性,始终是机器啃不动的硬骨头。

中国约有百万量级的线束工人;年产300万辆车的体量背后,就有十几万人在支撑这个单一工种。在整个工业体系里,很难找到第二个如此高密度的人力聚集在单点任务上的环节。

再看历史的镜像。上一个机器人时代的起点,是ABB那代人为解决汽车喷涂问题。这是一个对人体高度不友好、机器又干得比人好的场景。依托机械臂的正逆解方法,也由此开创了整个工业机器人产业。

但这一代明显不同。不再是谐波减速器和运动学解算,而是具身AI。如此一来,同样是汽车工业里“人干不好也不想干”的顶级难题,线束之于这一代,就像喷涂之于上一代。

最后是制高点逻辑。线束装配集齐了柔性操作、精密控制、严格节拍、可靠性要求,是汽车装配中最难的环节。而从高难度任务向低难度场景泛化容易,反过来极难。因此解掉线束难题,就等于解锁了一整篮问题。 

而且制造场景自带训练价值:海量真实作业数据、明确的评价标准、丰富多样的任务,是训练世界模型、验证物理AI能力的最佳沙盒,这也正是“物理世界的Coding”这个类比的深意。

进度上,陈亦伦在早前公开场合表示,它石在这个场景已投入约超14个月,目前产业化已经启动。

06.

写在最后

对于物理世界的“AI Coding时刻”什么时候来?目前还没有明确的答案。

但陈亦伦给出了一份可以被检验的清单:千万小时级真实数据、原生基座模型的持续迭代、千台级工业集群的规模化部署。

上一次,他在自动驾驶领域亲眼见过5000小时数据引发质变的那一刻。这一次,他把同一个剧本押在了大一个数量级的赌注上,而开局的落子,是一条最不性感、也最难啃的汽车线束。

由此来看,或许物理世界的“AI Coding时刻”很快就会到来。

点击查看全文
评论赞0分享
轨迹
物理AI它石智航

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4