“我们原来做ITO(信息技术外包)业务,2024年公司战略转型,AI基础设施服务、Token服务是重点的发力方向。我们有9万名程序员,在Coding场景已经形成商业闭环的背景下,先不说对外提供服务,我们内部都急需Token,所以我们做Token工厂有必然性,它是一个重要的技术、资源储备的过程。”软通动力相关负责人告诉财联社记者。
而在中国(河北)自由贸易试验区正定片区,由常山北明(000158.SZ)投资兴建的常山云,大模型API(Token)销售服务也在如火如荼地开展。
“模型能力在快速普及,但是真正用上AI的门槛还没有降下来。常山云词元工厂就是为了降低这个门槛,把AI算力做成一种随取随用、价格透明的公共基础能力。词元工厂上线十来天已经有100多个客户,个人用户词元调用量77亿。”常山云技术总监李强介绍。
财联社记者获悉,这座冀南地区建设规模最大、等级最高的第三方,已完成从传统机柜托管向智能算力服务的战略转型,建成“北明智擎”智能算力创新赋能平台,总算力达2248P。
这是2026中国算力大会前夕,财联社记者透过“算力中国行”(京津冀)调研活动观察到的两个上市公司转型案例。继此前的算力租赁转型潮后,今年Token工厂模式集中规模化落地,数十家A股上市公司入局,云厂商一体化玩家、第三方独立运营商(如硅基流动)、硬件资源持有方均盯上Token服务市场的“蛋糕”。
Token作为大模型处理信息的最小标准化单元,解决了AI产业长期缺乏统一算力与服务度量标尺的行业难题,已是AI产业的核心生产要素。在2026中国算力大会,Token受到与会者的高度讨论。
中国工程院邬贺铨院士在大会主论坛上谈到,智能体显著增加了Token调用量,今年3月国内Token的消费已经达到日均140万亿。“Token的消耗并不是以多为荣,而是以效率为荣。”邬贺铨院士还明确指出。
2026中国算力大会期间,中国信通院云大所算力中心与能源部主任王月介绍,智算产业已形成“基础设施交付-集群组织调度-Token能力输出-行业应用落地”四层供给架构。其中,Token服务是一种将异构算力封装为标准化推理产能的新型交付业态,通过屏蔽底层多架构硬件差异,将异构智算资源统一封装为以Token为计量单元的标准化推理产能,面向各类AI应用提供可调用、可计量、可交易的专业化推理算力供给。
“Token工厂本质是把传统的卖GPU算力,转为把算力和推理引擎、模型、负载调度等服务打包,直接对外交付按Token计量的标准化推理服务。”IDC中国研究副总裁周震刚向财联社记者表示,传统算力供给通常按卡、整机或机柜集群租赁算力,而Token工厂交付的是可直接调用的Token产出。
具体到与传统算力租赁的核心差异上,王月从计费单位、交付标的、用户负担等细分维度将GPU卡时租赁与Token服务进行了对比。前者采用GPU小时计费,交付标的为硬件实例,用户需负担的是部署、调优、运维;后者按Token个数计费,Token消耗量为交付标的,用户负担仅API调用。
在周震刚看来,Token工厂的意义最主要在于推动推理算力标准化,通过统一计费标准和SLA,帮助加速AI应用层(智能体Agent等)规模化落地。一方面,统一做模型量化、KV Cache及多模型路由,可以提升算力产出效率;另一方面,提供轻量化接入,中小企业无需自建私有集群,直接采购Token即可快速上线服务,降低AI创新门槛。
而对于模型厂商和应用开发者而言,也可以把算力调度、推理工程化外包出去。“让模型厂商专注模型迭代,让最终用户/ISV专注于Agent开发。”周震刚表示,这有助于降低相关主体的基建与运维负担,减少资本开支。
北京壹号词元工厂相关负责人也谈到,“Token工厂更贴近应用层,对外面向大模型厂商、云厂商、C端客户售卖Token。”软通动力已在北京亦庄、广东韶关、贵州贵阳投建三座词元工厂,三座工厂规划日产能超3万亿,未来计划在全国多个算力节点城市完成词元工厂布局。
据财联社记者梳理,目前已有包括润建股份(002929.SZ)、弘信电子(300657.SZ)、行云科技(300209.SZ)、超讯科技(603322.SH)、南威软件(603636.SH)、证通电子(002197.SZ)、紫光股份(000938.SZ)、网宿科技(300017.SZ)、优刻得-W(688158.SH)、青云科技(688316.SH)在内的不少上市公司加快布局Token服务业务。今年5月,中国电信(601728.SH)百亿级Token工厂集采落地,更是引发产业高度讨论。
从需求场景看,北京壹号词元工厂方面介绍,目前超过50%的业务量集中在Coding场景,其次是AI办公等领域。
“Token的运转其实是三件事:需求、运营和供应。需求决定了消耗的总量,运营决定了成本,供应决定了天花板。”常山云技术总监李强介绍。
向Token化算力服务转型,意味着运营方需要承担更多责任。硬件能否稳定运行、模型能否高效部署,以及不同客户的请求如何调度,都会影响最终交付的服务质量和成本。
价格方面,据邬贺铨院士在大会上介绍,每百万Token价格在2024年约为8-15元,2025年约为5-10元,2026年普惠模型仅0.02元,高端推理模型则达到10-30元。
王月分享的数据显示,日均Token调用量两年增长超千倍,供给端高端芯片供给受限,算力卡与存储芯片成本上行推高边际成本,供需缺口推动头部API输出价格一年余(2025年Q1-2026年Q2)上涨80%,当前市场呈现“量爆发、价上涨”格局。
“AI已经走过了‘能不能做’的功能验证期,现在进入的是‘能不能用好’的落地效率期,包括看落地效率怎么样,成本控制怎么样。”清程极智联合创始人师天麾近期接受财联社等媒体采访时表示,如今真正的门槛在于在真实的生产环境中,AI能否以可控的成本、稳定的质量、可接受的延迟,持续地输出价值,而Token恰恰是把这三个维度串起来的“公分母”。
评论交流
0