算力生意开始计算Token产出。
国产算力产业来到分水岭,GPU采购量持续增长,真正能够稳定输出的Token却未必同步增加。
IDC与中国信通院今年面向250家企业开展的调研显示,近半数受访企业的智算资源利用率处于51%至70%,另有6.7%的企业处于31%至50%。制造、政务等行业中,利用率达到70%以上的企业占比不足35%。部分自建项目完成了服务器和GPU部署,但统一调度、资源池化、软件适配和动态分配系统仍有缺口。
这类现象在行业内被概括为“重硬轻软”。
芯片提供理论算力,模型部署和推理服务需要整套软件链配合。驱动、算子库、通信组件、推理引擎、存储和网络,任何一环出现问题,GPU都可能跑不满,甚至跑不起来。
国产GPU进入更多以后,软件生态逐渐成为影响使用效率的核心变量。
大模型部署工程有很多复杂的流程。
模型文件主要保存参数,本身无法直接在GPU上执行,需要接入推理引擎,由推理引擎调用底层驱动和算子,完成显存管理、任务调度、并行计算和Token生成。
目前业内常用的推理引擎包括vLLM、SGLang和TensorRT-LLM。华为昇腾还拥有MindIE等自有软件组件。不同引擎支持的模型架构、量化方式和芯片环境存在差异。一个新模型发布以后,换一款GPU运行,往往涉及代码修改、算子开发、参数调优和稳定性测试。
英伟达长期积累的优势也在这一领域。CUDA工具包已经覆盖编译器、运行库、调试工具和大量加速库。开发者拿到英伟达GPU,可以沿着一条成熟的软件路径完成开发。国产GPU厂商数量众多,各家的硬件架构、驱动和工具链各不相同,模型厂商很难在发布时兼顾所有芯片。
GPUStack联合创始人、CTO梁胜将这种局面概括为“多对多”问题。
“根本上需要解决多对多的问题,上面有多个模型,下面有多个GPU。”梁胜说。模型、芯片和推理引擎持续增加,组合数量随之扩大,依靠项目团队逐个适配,成本会越来越高。
类似问题已经引起测评机构关注。2025年,中国信通院启动DeepSeek国产化适配测评,测试内容除了模型能否在国产软硬件系统上运行,还包括工具链易用性、适配成本、功能完备性和性能表现。
GPUStack所做的工作,可以放在这一产业缺口中理解。
这家公司2024年开源了同名AI基础设施平台,最初侧重GPU集群管理,现在把模型部署、推理引擎适配和Token服务放到了更重要的位置。
GPUStack CEO秦小康在接受21世纪经济报道记者采访时表示,早期客户关注如何获得和管理GPU,如今更关心模型能否顺利部署。“过去大家获取硬件资源,现在要帮助用户把资源之上的模型真正跑好。”
其解决方式,是在模型和GPU之间加入一个统一管理层。平台纳管不同厂商的GPU,根据模型和硬件环境选择推理后端,再通过统一API向上层应用提供服务。开发者面对相对一致的操作界面,底层可以使用英伟达、AMD或多款国产芯片。
GPUStack公开代码库目前列出的硬件包括英伟达、AMD、华为昇腾、海光、摩尔线程、天数智芯、沐曦、寒武纪和玄铁等产品,推理引擎支持vLLM、SGLang、TensorRT-LLM及自定义后端。
GPUStack COO江鹏演示了如何将八张昇腾910B、一张AMD MI300X和一张英伟达A100接入同一个集群,并把同一个模型的三个副本部署到三类硬件上。
演示过程中还出现一段小插曲。推理后端版本选择有误导致了重新创建节点。这个细节恰恰说明了,异构算力管理的难点远不止“把几张卡放进同一张列表”。平台还要识别硬件环境,为模型匹配对应的推理引擎和软件版本。
评论交流
0