商汤大装置首提TPW,重新定义AI基础设施效能标尺

商汤大装置首提TPW,重新定义AI基础设施效能标尺

Aggregate
Body

如何用有限的能源和成本,产出更多Token?这是Token经济时代,AI基础设施面临的新课题。

Token消耗指数级增长,算力需求持续攀升,随之带动的是AIDC用电量在全社会用电结构中的占比快速提高。行业对AIDC关注的焦点不再只是“谁拥有更多算力”,更开始关心“谁能以更低成本、更高效率生产更多高质量Token”。

在商汤大装置智算中心总经理林海看来,Token经济时代,AIDC需要被重新理解为连接电力与Token的价值平台,能把“算力”和“电力”的协同优化做到什么程度,成为决定未来商业竞争力的关键变量。

 

【商汤大装置智算中心总经理林海】

 

01 Token经济下,只看PUE为什么走不通了?

AI基础设施的效率,究竟应该如何衡量?又该如何持续提升?很长一段时间里,这个问题的答案是PUE。PUE作为数据中心总能耗与IT设备能耗的比值,长期以来被行业视为衡量数据中心能效的“黄金标准”。过去十几年,行业几乎所有的节能努力都围绕PUE展开,从机房气流组织优化到制冷系统架构革新,从自然冷却利用到液冷技术规模化部署,每一轮的目标都是把PUE压得更低。

但现在AIDC的服务模式开始从“卖卡时”转向“卖Token”。生意的计量单位变了,评价效率的标尺自然需要同步迭代。PUE更关注“用了多少电”,却回答不了“这些电产出了多少有效价值”,这正是当前AIDC行业正在共同面对的认知空白。

根源在于,现有的产业分工下,电力投入与Token产出的“数据链路”长期处于断裂状态。

四层分工各自为政,每层只优化自身环节指标,全局最优也就无从谈起。

更深层的矛盾,来自旧效率标尺的局限性,PUE下降并不必然意味着总能耗或Token成本同步下降。林海举例说,调高送风温度可能降低制冷能耗,让PUE账面数据更好看,却会使GPU与服务器风扇功耗上升,最终总用电未必下降,Token产出成本甚至可能升高。

既然PUE无法准确回答“这些电创造了多少价值”,行业就需要一个新的度量标尺。

02 从PUE到TPW,重构AIDC的效能标尺

基于此,商汤大装置提出了一个全新的效率指标:TPW(Tokens Per Watt),以单位电力成本产生的有效Token作为核心指标,统一衡量算力效率、能源效率与业务价值。

简单来说,PUE衡量电力使用效率,TPW则进一步回答每一度电最终产生了多少有效Token,并将分时电价等因素纳入经济性评价,推动行业的关注重点从“用了多少电”,转向“这些电形成了多少有效产出”。

TPW并非对PUE的简单否定或替代,而是在PUE基础上,进一步打通从电力投入到Token产出的全链路效率评价。过去分散在各环节的优化动作,包括电价、储能、PUE、GPU利用率与模型效率,由此开始指向Token产出这同一个价值指标。

对行业而言,TPW的价值不止于一个新指标,更在于它建立了一套统一的价值语言。电网、IDC、算力平台、模型厂商,可以在同一个标尺衡量下进行结果优化,算电协同也变成了可度量、可复制、可商业化的系统能力。

03 算电协同如何实现系统级效能优化

有了新的度量标尺,接下来的问题是:如何让AIDC在既定电力条件下产出更多Token?

商汤大装置给出的答案,并不是简单增加算力或扩容电力,而是通过算电协同Agent,对算力任务、能源供给和基础设施进行统一编排调度,充分释放分时电价、需量控制和需求响应中的时间价值,每一度电发挥更高效能。

这套路径,分为数据贯通、任务调度和算电协同三个层面:

第一步:打通数据,建立可观测底座

优化的前提,是可观测。

传统IDC中,电力系统关注楼栋、机柜、服务器等物理设备,算力平台关注Job、Pod、Node等云原生任务,两套体系长期独立运行,难以回答两个关键问题:是谁在用电?这些负荷是否可以调度?

为此,商汤大装置构建了八级数据穿透体系,贯通任务、算力资源与物理用电之间的映射关系,将GPU利用率、任务功耗、机柜负荷、楼栋用电等数据统一到同一时间轴和观测体系中,实现每一度电与每一个算力任务的精准对应,为后续预测、调度和优化提供统一的数据底座。

商汤大装置智算中心运维总监张煦介绍到:“可以看到,在临港AIDC的监控大屏上,这种映射已经落地为实际运行能力,任务实时功耗、节点GPU利用率、机柜及楼层负荷、楼栋IT功率与进线侧用电数据,都被纳入同一条观测链路,实现了每一度电的去向和产出都可追溯。”

第二步:任务分级,释放资源弹性

数据打通之后,真正的优化才开始。

商汤大装置并不是简单迁移任务、增加硬件等,而是根据不同任务的时效要求,对算力资源进行智能调度。

在线推理等实时业务必须即时响应,而训练、评测、批处理等任务则可能具有分钟、小时乃至跨日的调节空间。系统根据业务优先级和延迟容忍度,自动将部分可调度任务安排到低电价、低负荷或资源更充裕的时段运行,在保障服务质量的前提下,提升整体资源利用率。

这种优化并不会减少总用电量,而是通过优化时序把空闲资源和电能更充分地利用起来,让同样的容量、同样的电量,产出更多有效Token,从而带来TPW的提升。

第三步:多维协同,放大负荷弹性价值

商汤大装置进一步结合容量挖潜、储能调度和电网需求响应,实现算力与能源的动态协同。并通过负荷预测、容量优化和储能削峰等,充分释放既有基础设施的资源潜力,在不新增供电容量的前提下,让有限电力承载更多有效计算任务。

张煦提到:“实测数据显示,在既有供电条件下,IT有效承载能力可提升约60%。这一提升并非来自新增供电容量,而是通过系统级协同,让同样的MW容量可以承载更多有效计算,实现AI基础设施整体效率的持续提升。”

【商汤大装置智算中心运维总监张煦】

 

04 临港AIDC实践:算电协同走向规模化验证

这套方法论已经在商汤临港AIDC完成了规模化验证。

在今年7月10日上海市迎峰度夏电力需求响应中,商汤临港AIDC率先启动算电协同调度模式,实现午间常规用电负荷削减75%,可调负荷规模达23MW,通过非关键任务暂停、基础设施降耗、储能放电等算力电力协同措施,在两小时向电网释放了4.6万度削峰电量。

这意味着,AIDC与电网的关系正在发生改变。过去,智算中心更多是需要重点保障的刚性负荷;如今,当算力任务能够被识别、分级和智能调度后,负荷弹性便成为一种可运营、可调度的新型资产。算力任务可以根据业务优先级灵活安排执行时机,储能系统、算力资源与电网需求也能够协同联动,共同参与电网需求响应。

从PUE到TPW,AI基础设施优化的不再只是设备能效,而是整个算力系统的运行效率。商汤大装置所释放的,并非新增的算力或电力,而是隐藏在任务弹性、资源调度和能源协同中的系统效能。

05 算电协同Agent:让TPW真正落地的智能调度系统

TPW不仅是一套新的效率标尺,更需要一套能够持续提升TPW的智能系统。

源于商汤多年智算中心运营实践,商汤大装置打造了算电协同Agent,构建了一个会感知、能思考、可决策、可执行、持续进化的智能调度系统。不同于传统能源管理平台只关注电力侧,算电协同Agent能够同时连接算力、能源和业务,实现全链路协同优化,让每一度电持续创造更多Token。

 

 

在能力架构上,算电协同Agent依托八级数据穿透体系、五大智能决策链和六大运营能力,打通任务、算力、能源与基础设施之间的数据壁垒,形成从感知、预测、决策、执行到度量的完整闭环。系统不仅能够实现负荷预测、电价分析、储能优化、容量控制、暖通协同、算力调度等智能决策,更以TPW作为统一优化目标,将过去分散在不同系统中的优化动作统一到同一套效率体系中。

目前,算电协同Agent已全面应用于商汤临港AIDC,实现单位电力成本Token产出提升80%、平均电费单价低于同地区IDC约10%、算力负荷预测准确率达到96%。

商汤大装置智算中心运维总监张煦介绍到,为了让这一能力能够复制到更多智算中心,商汤大装置算电协同Agent采用平台化、模块化设计,将多年运营经验沉淀为可复用的Agent能力,并依托FDE(Field Domain Expert)专家体系形成标准化交付流程,新场景最快一周即可完成部署上线,实现算电协同能力快速复制。

对于国家算力枢纽节点、万卡级智算中心等大型AI基础设施,算电协同Agent能够统一调度算力、能源与储能资源,提升集群整体算效,优化绿电消纳和综合用能成本。

对于算力运营商、AI云服务商以及Token工厂,系统能够结合电价预测、负载优化与算力调度,实现单位Token电力成本持续下降,在保障业务SLA的同时提升资源利用率和运营收益。

对于企业级智算中心、科研机构以及行业AI平台,依托模块化架构和标准化交付体系,客户无需重构现有基础设施,即可快速部署算电协同能力,构建更加智能、高效、绿色的智算中心运营体系。

商汤大装置智算中心总经理林海认为,从PUE到TPW,变化的不只是评价指标,更是AI基础设施的运行方式。未来,算电协同将不再只是智算中心的节能手段,而是连接算力、能源与业务的核心能力。商汤大装置希望通过算电协同Agent,让系统优化能力实现标准化、产品化和规模化复制,推动AI基础设施进入系统级算效时代。

Domain Tag
tech
Source Name
雷锋网