JavaScript is required

当算力开始按Token计价:燧原的下半场打法

在刚刚落幕的2026世界人工智能大会上,如果留心听各家的发布会和论坛,会发现一个微妙的变化:被讨论最多的不再是参数规模,也不是集群里有多少张卡,而是Token 。每百万Token的成本是多少?每秒能吐出多少Token?一个Agent跑完一个任务要消耗多少Token?

当一个产业的计价单位发生变化,往往意味着竞争逻辑的重写。就像云计算从“卖服务器”变成“按调用计费”重塑了整个IT产业一样,AI算力正在经历同样的转折。

燧原科技创始人、董事长、CEO赵立东在7月18日的“构建协同创新的Token经济芯生态”论坛上给出了明确判断:全球人工智能产业已经进入下半场,行业关注重心正从“算力规模”转向“Token价值”。

这不是一句口号。围绕这个判断,燧原在本届WAIC上交出了一份完整的答卷,一场与腾讯的深度对话,三项系统级发布。把它们串起来看,能看到一家国产算力公司对下半场的完整打法。

图片

01.

为什么是Token?下半场的三个信号

赵立东把这个转变拆解为三个维度,每一个纬度都指向市场结构的深刻变化。

第一个信号:推理算力需求已经超过训练算力需求。

训练是一次性的资本开支,头部玩家买卡建集群,市场随大模型军备竞赛起落;而推理是持续性的运营开支,只要应用在跑,Token就在被消耗,算力就在被计费。市场驱动力从CapEx(资本性支出)转向OpEx(运营支出),意味着算力从“项目型生意”变成“流量型生意”,这代表着天花板更高,收入更可持续,但对成本的敏感度也呈数量级上升。

与此同时,国内持续繁荣的大模型开源生态大幅降低了二次开发的技术与资金门槛,基于基础大模型的场景落地正在加速。应用越繁荣,推理需求越大,这个飞轮已经转起来了。

第二个信号:产品形态从交互式AI向智能体AI跃升。

一问一答的Chatbot,Token消耗是线性的;而一个能自主规划、自主决策、自主调用工具完成复杂任务的Agent,跑完一个任务可能要消耗成千上万倍的Token。Agent的普及意味着Token消耗量级的跳升,同时对算力的实时响应、多模态处理、长时间稳定运行和长期记忆存储都提出了全新要求。

第三个信号:客户的付费逻辑变了。

客户不再单纯为硬件成本付费,而是以Token生成效率与交付质量为核心评判标准。腾讯混元推理负责人朱健琛在与燧原科技创始人、总经理张亚林的深度对话中补充了一个重要观察:市场正在分化为两极,一端是追求极致体验的高端客户,要的是最快的模型输出、最低的首Token延迟;另一端是海量的规模化需求,对成本极度敏感,性价比“磕到底”。两极商业模式共同催生了对差异化算力的需求。

三个信号指向同一个结论:对芯片公司而言,单卡性能不再是唯一答案。当客户按Token付钱,比拼的是系统级的综合成本,从芯片、封装、整机、集群到软件的每一层,都要为“更便宜、更快、更稳定地生产Token”服务。

这就是燧原打法的起点。

02.

芯模协同:把Token成本打下来的方法论

如果说Token经济是命题,“芯模协同”就是燧原给出的解题方法论。

张亚林对这个词的定义值得细读:“芯模协同是芯片和模型的双向奔赴、双向成就。模型依据芯片硬件特性调整结构设计,芯片也针对模型架构做专属加速优化。”注意这里的关键词是“双向”,不是芯片单方面去适配模型,而是模型也在主动向芯片靠拢。

这在国产芯片的语境下意义重大。过去几年,国产AI芯片的叙事大多停留在“能不能用”:能不能跑通主流模型、生态迁移成本有多高。而“双向奔赴”意味着关系的逆转,头部模型厂开始基于国产芯片的特性来设计模型。

朱健琛在对话中透露的细节,是本届WAIC上最值得关注的信息之一。腾讯已经把芯模协同的工作前置到了模型设计阶段。团队会基于AI芯片的各项性能指标,反向设计MoE、Attention等结构和参数,同步启动推理优化与工程适配;从软件栈、算子库开始,与芯片厂商一层一层做严格的精度对齐。

换句话说,在腾讯的工作流里,芯片特性已经是模型架构设计的输入变量,而不是事后适配的对象。这种深度的Co-Design,覆盖的也不只是芯片和模型两层,机柜、集群、存储、互联,整个硬件系统都在协同设计的范围之内。

支撑这种深度绑定的,是七年的业务验证。自2019年起,燧原与腾讯基于燧原算力产品开展深度合作,目前已在企业级在线会议、国民级社交应用、大模型数据清理、游戏AI以及搜索、广告、推荐等互联网核心业务中实现规模化应用。此外,燧原的高性能推理产品也已应用于Coding Agent、AI搜索、多模态理解、视频生成等大模型场景,在互联网客户及各地智算中心实现规模部署。

对国产芯片而言,“被头部模型厂主动适配”是比任何跑分都硬的竞争壁垒。跑分可以优化,Demo可以打磨,但一家互联网大厂愿意把核心业务的推理负载放上来、愿意为你的芯片反向设计模型结构,这背后是七年真金白银的业务验证,也是Token经济时代最稀缺的信任资产。

03.

三大发布:系统级降本的三条路径

方法论之外,燧原在论坛上正式发布了三项成果。如果把它们当作三条新闻看,是三次联合发布;但放在“降低Token综合成本”的框架下看,它们分别代表三条路径:向系统要效率、向封装要突破、向天上要边界。

路径一:向系统要效率——云燧ESL64-O超节点

随着大模型训练和推理规模迈向万卡时代,超节点正成为AI算力基础设施的关键系统形态,尤其是在高并行推理场景下,卡与卡之间的互联效率直接决定Token的产出速度和成本。

燧原联合中兴通讯发布的云燧ESL64-O超节点,采用OEX正交无背板设计,实现零线缆、互联成本大幅降低,并大幅缩短产品上市周期,具备低时延、高可靠、强信号、优散热、易扩展、便捷运维六大优势。与之形成组合的,还有基于成熟Cable-tray方案的云燧ESL64-C。前者代表自主架构创新,后者胜在部署门槛低、灵活组网,一套“双方案”覆盖不同客户的落地节奏,恰好呼应了前文提到的两极市场。

图片

值得一提的还有燧原展示的NPO光互连原型系统方案。改方案突破传统铜互连的距离限制,支持512卡以上超节点部署及超大规模集群弹性扩展。当推理集群规模持续膨胀,互联技术就是下一个成本瓶颈,这一步棋是提前落子。

图片

路径二:向封装要突破——CoPoS面板级先进封装

燧原携手先封科技发布了适配AI算力芯片的CoPoS(Chip-on-Panel-on-Substrate)面板级先进封装样品,燧原自研高端AI芯片首次与国产化CoPoS先进封装核心技术相结合。

图片

这项发布的份量需要放在产业背景下理解。先进封装已经成为全球AI芯片的产能咽喉,也是国产供应链上最需要补齐的环节之一。CoPoS方案体现了玻璃材料在封装基板、临时载板等环节的迭代应用,具备热膨胀系数可调、高频信号损耗极低、平整度优异、超大面板成型等技术优势。对燧原而言,这是向产业链上游的纵深布局。即把决定芯片性能上限和成本下限的关键环节,握在自主可控的链条里。

路径三:向天上要边界——天基算力应用场景

三项发布中最有想象力的一笔,是燧原联合星际天算发布的天基算力应用场景。双方打造的分布式立体算力网络,突破了商用芯片抗辐加固、大功耗能源供给与热管理、云原生分布式架构三大核心技术壁垒,推动算力从“天感地算”走向“天数天算”、“地数天算”,最终迈向天地协同一体化。

图片

而这项发布中最点题的一句话是:双方将把复杂的天基算力,解构为标准化的计算Token,提供通用算力服务、数据中继服务、智能计算服务三大核心服务。

算力上了天,计价单位依然是Token,这恰恰印证了全文的立意:Token正在成为跨场景、跨介质的通用度量衡。无论算力部署在地面机房还是近地轨道,最终交付给客户的,都是标准化的Token。

三条路径,三个方向:超节点向系统纵深走,封装向产业链上游走,天基算力向场景边界走。指向的是同一件事,即在系统级、架构级层面优化算力综合成本,支撑Token经济。

04.

三大生态的交汇点

深度对话的最后,张亚林把整个AI产业归纳为三大生态链条:一是半导体产业链,涵盖设计、制造、封装、测试;二是数据中心生态,包含集群、液冷、板卡、存储、互联,共同构成完整的算力系统与运维能力;三是模型与应用生态,包括基础大模型、智能体产品与各类落地场景。

三大生态深度打通,产业潜力才能充分释放。而回看燧原本届WAIC的动作,与中兴通讯做超节点、与先封科技做封装、与星际天算做天基算力、与腾讯做芯模协同。每一个合作,恰好都落在一条生态链上。燧原给自己的定位,不是单一的芯片供应商,而是三条生态链的交汇点。

时间窗口也站在这一边。“十五五”规划纲要明确部署全面实施“人工智能+”行动,统筹布局算力基础设施、持续供给高性能高品质智算资源。用赵立东的话说,国产AI算力产业正迎来黄金发展期,以“芯模协同”为核心抓手的国产AI生态建设,已进入双向赋能、良性循环的发展快车道。

七年WAIC同行,燧原从一家云端AI芯片公司,成长为覆盖芯片、加速卡与模组、智算系统及集群的全栈算力公司。

而下半场的竞争规则已经清晰:当算力开始按Token计价,比拼的不再是谁的卡更多、谁的峰值算力更高,而是谁能以更低的成本、更高的质量,生产每一个Token。

这是燧原对下半场的回答:答案不在某一颗芯片里,而在从芯片到模型、从封装到集群、从地面到太空的整个系统里。

点击查看全文
评论赞0分享
轨迹
Token燧原算法

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4