直击2026中国算力大会:算力租赁潮之后 上市公司扎堆“建厂”卖Token

直击2026中国算力大会:算力租赁潮之后 上市公司扎堆“建厂”卖Token

  位于北京亦庄的北京壹号词元工厂内,一块大屏幕上显示了TTFT(Time to First Token ,首Token响应时间) 、TPOT(Time Per Output Token,Token输出耗时)、TPM(Tokens Per Minute,分钟级Token吞吐量)等关键指标 ,直观反映这座由软通动力(301236.SZ)投建,今年6月刚刚投产、日产Token1.4万亿的词元工厂的运行状况。

直击2026中国算力大会:算力租赁潮之后 上市公司扎堆“建厂”卖Token-第1张图片

  “我们原来做ITO(信息技术外包)业务,2024年公司战略转型 ,AI基础设施服务 、Token服务是重点的发力方向 。我们有9万名程序员,在Coding场景已经形成商业闭环的背景下,先不说对外提供服务 ,我们内部都急需Token ,所以我们做Token工厂有必然性,它是一个重要的技术、资源储备的过程。 ”软通动力相关负责人告诉财联社记者。

  而在中国(河北)自由贸易试验区正定片区,由常山北明(000158.SZ)投资兴建的常山云数据中心 ,大模型API(Token)销售服务也在如火如荼地开展 。

  “模型能力在快速普及,但是真正用上AI的门槛还没有降下来。常山云词元工厂就是为了降低这个门槛,把AI算力做成一种随取随用、费用 透明的公共基础能力。词元工厂上线十来天已经有100多个客户 ,个人用户词元调用量77亿 。”常山云数据中心技术总监李强介绍。

  财联社记者获悉,这座冀南地区建设规模最大 、等级比较高 的第三方数据中心,已完成从传统机柜托管向智能算力服务的战略转型 ,建成“北明智擎”智能算力创新赋能平台,总算力达2248P。

  这是2026中国算力大会前夕,财联社记者透过“算力中国行 ”(京津冀)调研活动观察到的两个上市公司转型案例 。继此前的算力租赁转型潮后 ,今年Token工厂模式集中规模化落地,数十家A股上市公司入局,云厂商一体化玩家、第三方独立运营商(如硅基流动)、硬件资源持有方均盯上Token服务市场的“蛋糕” 。

  Token作为大模型处理信息的最小标准化单元 ,解决了AI产业长期缺乏统一算力与服务度量标尺的行业难题 ,已是AI产业的核心生产要素。在2026中国算力大会,Token受到与会者的高度讨论。

  中国工程院邬贺铨院士在大会主论坛上谈到,智能体显著增加了Token调用量 ,今年3月国内Token的消费已经达到日均140万亿 。“Token的消耗并不是以多为荣,而是以效率为荣。”邬贺铨院士还明确指出。

  从“租卡 ”到“买服务”,Token工厂改变了什么?

  2026中国算力大会期间 ,中国信通院云大所算力中心与能源部主任王月介绍,智算产业已形成“基础设施交付-集群组织调度-Token能力输出-行业应用落地”四层供给架构 。其中,Token服务是一种将异构算力封装为标准化推理产能的新型交付业态 ,通过屏蔽底层多架构硬件差异,将异构智算资源统一封装为以Token为计量单元的标准化推理产能,面向各类AI应用提供可调用 、可计量 、可交易的专业化推理算力供给。

(财联社记者摄)

  “Token工厂本质是把传统的卖GPU算力 ,转为把算力和推理引擎、模型、负载调度等服务打包,直接对外交付按Token计量的标准化推理服务。 ”IDC中国研究副总裁周震刚向财联社记者表示,传统算力供给通常按卡 、整机或机柜集群租赁算力 ,而Token工厂交付的是可直接调用的Token产出 。

  具体到与传统算力租赁的核心差异上 ,王月从计费单位、交付标的、用户负担等细分维度将GPU卡时租赁与Token服务进行了对比。前者采用GPU小时计费,交付标的为硬件实例,用户需负担的是部署 、调优、运维;后者按Token个数计费 ,Token消耗量为交付标的,用户负担仅API调用。

  在周震刚看来,Token工厂的意义最主要在于推动推理算力标准化 ,通过统一计费标准和SLA,帮助加速AI应用层(智能体Agent等)规模化落地 。一方面,统一做模型量化、KV Cache及多模型路由 ,可以提升算力产出效率;另一方面,提供轻量化接入,中小企业无需自建私有集群 ,直接采购Token即可快速上线服务,降低AI创新门槛。

  而对于模型厂商和应用开发者而言,也可以把算力调度 、推理工程化外包出去。“让模型厂商专注模型迭代 ,让最终用户/ISV专注于Agent开发 。 ”周震刚表示 ,这有助于降低相关主体的基建与运维负担,减少资本开支 。

  北京壹号词元工厂相关负责人也谈到,“Token工厂更贴近应用层 ,对外面向大模型厂商、云厂商、C端客户售卖Token。”软通动力已在北京亦庄 、广东韶关、贵州贵阳投建三座词元工厂,三座工厂规划日产能超3万亿,未来计划在全国多个算力节点城市完成词元工厂布局。

  据财联社记者梳理 ,近来 已有包括润建股份(002929.SZ)、弘信电子(300657.SZ) 、行云科技(300209.SZ) 、超讯科技(603322.SH)、南威软件(603636.SH)、证通电子(002197.SZ) 、紫光股份(000938.SZ)、网宿科技(300017.SZ)、优刻得-W(688158.SH) 、青云科技(688316.SH)在内的不少上市公司加快布局Token服务业务 。今年5月,中国电信(601728.SH)百亿级Token工厂集采落地,更是引发产业高度讨论。

  从需求场景看 ,北京壹号词元工厂方面介绍,近来 超过50%的业务量集中在Coding场景,其次是AI办公等领域。

  “量爆发、价上涨”格局下 ,成本约束也在变得具体

  “Token的运转其实是三件事:需求、运营和供应 。需求决定了消耗的总量,运营决定了成本,供应决定了天花板。 ”常山云数据中心技术总监李强介绍。

  向Token化算力服务转型 ,意味着运营方需要承担更多责任 。硬件能否稳定运行 、模型能否高效部署 ,以及不同客户的请求如何调度,都会影响最终交付的服务质量和成本。

  费用 方面,据邬贺铨院士在大会上介绍 ,每百万Token费用 在2024年约为8-15元,2025年约为5-10元,2026年普惠模型仅0.02元 ,高端推理模型则达到10-30元。

(财联社记者摄)

  王月分享的数据显示,日均Token调用量两年增长超千倍,供给端高端芯片供给受限 ,算力卡与存储芯片成本上行推高边际成本,供需缺口推动头部API输出费用 一年余(2025年Q1-2026年Q2)上涨80%,当前市场呈现“量爆发、价上涨”格局 。

  “AI已经走过了‘能不能做’的功能验证期 ,现在进入的是‘能不能用好’的落地效率期,包括看落地效率怎么样,成本控制怎么样。”清程极智联合创始人师天麾近期接受财联社等媒体采访时表示 ,如今真正的门槛在于在真实的生产环境中 ,AI能否以可控的成本、稳定的质量 、可接受的延迟,持续地输出价值,而Token恰恰是把这三个维度串起来的“公分母 ”。

  师天麾以公司服务的出海客户举例称 ,该类单一客户、单一模型的峰值用量可达1-2亿TPM 。面对这种大规模、高稳定的业务需求,清程极智采用“资源预留+弹性调度”的组合策略:将90%以上的基础负载通过自产的“赤兔”专线保障,剩余波动部分(如从1.2亿到1.5亿的弹性峰值)则通过智能路由动态调度 。

  而对于个人开发者或中小企业 ,其用量通常远未达到这一量级,“因此主要依靠智能路由技术,在保障高性能 、低延迟 、高成功率的同时 ,实现更高的资源利用率,从而降低其使用成本。 ”师天麾补充道。

  实际上,调用量增长的同时 ,成本约束也在变得具体 。

  师天麾在采访中提到,一位动漫导演曾向他坦言:AI辅助作画在技术上可以实现,但存在“抽卡”问题 ,质量时好时坏 ,为了得到一张可用的成片,往往要生成几十上百次,Token成本和后期筛选、修补的人力加起来 ,反而远超人工。“未来的AI竞赛,不再是模型参数规模的军备竞赛,而是单位Token产出价值的效率竞赛。”师天麾说 。

  财联社记者同时采访获悉 ,Agent架构设计是影响Token效率最关键的因素。传统的软件系统没有Token计费的概念,但在AI原生时代,缓存命中、上下文复用 、问题分流这些机制成为全新的工程实践 ,这也说明,Token效率优化已经从可选优化项变成了核心架构能力。

  算力有了,为什么高质量Token供给仍不足?

  王月认为 ,当前国内Token服务市场呈现“高度集中与分工细化并存、需求爆发与供给短板共生 ”的特征,中期演进将围绕技术效率深化、商业模式多元 、产业格局集中、标准体系完善四方向展开 。

  不过,异构算力一致性不足 ,费用 竞争激烈、盈利承压 ,行业标准体系不完善和合规治理要求趋严,仍是行业面临的挑战。王月认为,行业核心竞争正从资源占有转向全栈运营能力。

  值得关注的是 ,当前行业一方面强调高质量Token供给不足,另一方面仍存在算力利用不充分的情况 。

  据中商产业研究院发布的《2026年中国Token工厂发展白皮书》,我国已成长为全球Token生产与消费双中心 ,大模型Token调用量两年实现千倍级爆发,智能算力供给规模稳居全球第二,但行业普遍存在GPU平均利用率不足30% 、重建设轻运营的发展短板。

  周震刚认为 ,原因之一是此前大量算力建设主要面向训练集群为主,按大模型训练需求采购硬件。但近来 的Token主要消耗在推理 。训练集群硬件架构、组网、调度逻辑并不适配推理的短任务 、高并发特征,不匹配推理场景 ,硬件规模大但Token产出能力弱 。

  “另外,缺少推理调度、模型适配和运维运营以及国产芯片生态适配问题,都拉低了Token的有效利用率。”周震刚补充道。

  而具体到企业级服务层面 ,师天麾则认为 ,当前企业级服务普遍面临高质量Token供给不足的问题——“缺 Token”的本质是“缺卡 ”,供不应求导致费用 上涨 。

  不过师天麾也表示,费用 上涨也带来了一个积极信号:行业竞争正在从“卷费用 ”转向“卷服务”。“当 API 费用 不再是唯一的竞争维度 ,客户会更加关注 Token 的质量、稳定性和性价比。”

  今年7月的WAIC2026期间,燧原科技董事长赵立东也曾表示,“Token正成为AI产业的价值载体与计价单位 ,客户不再单纯为硬件成本付费,而是以Token生成效率与交付质量为核心评判标准 。这要求我们必须从系统级 、架构级层面优化算力综合成本。 ”

  在周震刚看来,未来竞争会显著加剧。前段时间大量厂商涌入 ,费用 战激烈但缺乏推理优化能力,很多仅靠硬件转租的 Token 工厂会被淘汰;未来头部玩家会形成稳定算力资源 + 推理软件到订单的闭环 。国产芯片适配和算电协同可能是Token工厂将获得差异化竞争的重点。

(文章来源:财联社)

©版权声明
THE END