| 项目 | 内容 |
|---|---|
| 标题 | Spatial LLM Workload Shifting Needs Foresight: Model Commitment for AI Data Center Operation under Power Grid Constraints |
| 作者 | Bojun Du、Hongyang Jia、Tonghui Li、Qingchun Hou、Ze Wang、Ershun Du、Ning Zhang |
| 单位 | 清华大学电机工程与应用电子技术系(B. Du、H. Jia、E. Du、N. Zhang);浙江大学 ZJU-UIUC Institute(Q. Hou);中国大唐集团科技创新有限公司(T. Li、Z. Wang) |
| 版本 | arXiv:2609.09787v1 [eess.SY],2026 年 9 月 9 日提交;3 页、2 图(letter) |
| 问题 | AI 数据中心在部分时段面临供电短缺,需把 LLM 推理负载在空间上转移;现有方法假设任何有算力的数据中心都能立即服务被转移的请求 |
| 方法 | Model Commitment(MC)——混合整数线性规划,联合调度模型部署与跨站点请求路由 |
| 结果 | 100% 请求服务率;相对无价格信号基线(B4,同为 100% 服务率)总运行成本下降 29.0% |
论文切入的角度值得单独说一句。过去两年,"算电协同"这个方向上的多数工作把数据中心当成一个可调度的柔性负荷——给它一个功率上限,让它自己想办法压下去。这类模型隐含一个假设:算力是可以瞬时、自由地在空间上搬动的资源。
论文作者团队否认这个假设,理由很具体:一个 LLM 推理请求,只能被送到已经加载了对应模型副本的那个数据中心。副本不是凭空存在的,把一个 32B 或 70B 量级的模型装进 GPU 显存并完成预热,需要几十分钟量级的时间。因此"现在决定把算力搬到另一个州"这句话,在工程上是不成立的——你必须在几十分钟前就做出决定。
于是,电力系统里那个最经典的难题被搬进了数据中心:机组组合(Unit Commitment, UC)。机组不能说开就开,要提前开机、要最小启停时间、要付启动成本;模型副本不能说装就装,要提前加载、要加载提前期、要付加载能耗与 I/O 占用。论文把这个对应关系写成了显式约束,并给它起了个名字——模型承诺(Model Commitment)。
MC 从数据中心运营商的视角建模,调度分辨率取 15 分钟,输入是请求需求、供电上限与节点电价,输出是每个数据中心上模型副本的常驻状态,以及请求在各站点之间的空间路由。
式(1)把所有请求需求切成两部分:
Σn qr,m,n,t + sr,m,t = Dr,m,t
其中 r 是需求区域、m 是模型类型、n 是数据中心、t 是时段;q 是路由到数据中心 n 的 token 量,s 是未服务的 token 量。这个式子的意义在于:它把"服务不了"变成了一个有价格的变量,而不是一个不可行的约束。这是需求响应建模里最常见的处理手法——和电力系统里"失负荷"被赋予 VOLL(失负荷价值)是同一个思路。
min Σr,m,t πm · sr,m,t + Σn,t λn,t · Pfacn,t · Δt
第一项是未服务 token 的经济损失(πm 为单位损失),第二项是电费(λn,t 为节点电价,Pfacn,t 为设施功率)。这两项天然对冲:把请求送到电价低的站点能省电费,但如果那个站点没有足够的已加载副本,就会产生未服务惩罚。MC 的全部优化张力,就在这两项之间。
式(3)是全文的技术核心。先看三个变量的角色:ym,n,t 是在 t 时段发起加载的模型 m 副本数,zm,n,t 是卸载数,xm,n,t 是在时段 t 全程服务就绪的副本数。
xm,n,t = xm,n,t−1 + ym,n,t−L − zm,n,t · Lld = max(1, ⌈Trd / Δt⌉) · ηld = Lld − Trd / Δt
这里 Trd 是物理就绪时间,Lld 是把它折算成的整数调度周期数。第三项 ηld 最容易被读错,它出现在式(3c):
x̃m,n,t = xm,n,t + ηldm,n · ym,n,t−L+1
本文做了三组验算,确认它的物理含义:η 是在 t−L+1 时段发起加载的那一批副本,在 t 时段内能够提供服务的时长比例。
| 物理就绪时间 Trd | Δt | Lld | ηld | 物理含义(本文验算) |
|---|---|---|---|---|
| 10 分钟(论文举例) | 15 分钟 | max(1, ⌈0.667⌉) = 1 | 1 − 0.667 = 0.333 | t(= t−L+1)当期发起,10 分钟即完成,当期剩余 5 分钟可服务,比例 5/15 = 1/3 |
| 40 分钟 | 15 分钟 | ⌈2.667⌉ = 3 | 3 − 2.667 = 0.333 | t−2(= t−L+1)发起,40 分钟后在 t 时段开始后 10 分钟完成,当期可服务 5/15 = 1/3 |
| 60 分钟(论文算例) | 15 分钟 | ⌈4⌉ = 4 | 4 − 4.000 = 0 | t−3(= t−L+1)发起的一批恰在 t 时段末完成,当期可服务时长为 0,故无部分贡献 |
三组验算与 η = L − Trd/Δt 完全吻合,说明式(3c)做的是一件很朴素的事:把"跨周期的加载进度"折算成"当期的等效可用副本数"。它的一般形式是可服务时长 = L·Δt − Trd,除以 Δt 即为 η。
η = (Lld·Δt − Trd) / Δt = Lld − Trd / Δt
式(4)处理一个工程细节:同一个模型在同一时段不能既加载又卸载,用 0/1 指示变量 δ 加大 M 法实现:
ym,n,t ≤ M · δm,n,t · zm,n,t ≤ M · (1 − δm,n,t)
式(5)则定义了 ℓm,n,t——正在加载中的副本数,即最近 L 个周期内发起、尚未就绪的加载批次之和:
ℓm,n,t = Σk=0..L−1 ym,n,t−k
它们还没进 x(不能服务),但已经占了 GPU 和显存。这个处理很关键,因为它意味着"加载"这个动作本身是有资源成本的。
把 MC 的约束结构与机组组合逐项对照,会发现这不是比喻,而是同构。论文自己也点明了这一点——"类似于机组组合中的机组启动"(similar to generator start-up in UC)。
式(6)给的是算力侧的硬约束。GPU 卡数约束为 Σm am,n · (xm,n,t + ℓm,n,t) ≤ An,t;显存约束为 Σm (gm + κm) · (xm,n,t + ℓm,n,t) ≤ Gn,t,其中 gm 是模型权重显存、κm 是每副本预留的 KV cache 显存。两式都把加载中的副本算进占用,这是对的——加载过程必须先在显存里把权重铺开。
式(7)把算力翻译成电力。设施功率拆成三项:
| 功率分量 | 表达式 | 物理含义 |
|---|---|---|
| 常驻功率 Pidle | Σm pidlem,n · (x + ℓ) | 副本常驻显存时的基础功耗,与是否处理请求无关 |
| 推理功率 Pinf | (1/Δt) · Σr,m em,n · q | 按每输出 token 的增量电能折算,由路由量决定 |
| 切换功率 Psw | (1/Δt) · Σm (Eld · y + Eul · z) | 加载与卸载动作的能耗,即"启动成本"的电力表达 |
| 设施功率 Pfac | PUEn · (Pidle + Pinf + Psw) ≤ P̄n,t | 乘 PUE 后受需求响应事件的功率上限约束 |
这里有两个值得强调的结构。第一,Pidle 与副本数成正比,与请求量无关。这意味着常驻副本本身就是一笔固定的电力账单——正是这个性质让"要不要保留一个副本"变成一个真正的启停决策,而不是免费的。第二,约束 P̄n,t 是分时段的供电上限,直接对应需求响应事件。论文的模型里,数据中心不是在"响应价格",而是在"响应价格 + 供电可用性"两个信号。
这是论文第二个贡献,也是被工程实践低估最深的一块。一个副本就算加载好了,能接多少请求也不是无限的——它受延迟约束。论文把两段延迟分别折算成容量上限。
分配给一个副本的请求共享它的服务队列。论文用 M/G/1 近似给出单副本的平均 TTFT:
E[TTFT] = Tpre + ν · (Tpre)² / [ 2 (1 − ν · Tpre) ]
其中 ν 是分配到单副本的请求到达率,Tpre 是平均 prefill 服务时间。本文对照排队论的标准形式做一步核对:Pollaczek–Khinchine 平均等待时间公式为 Wq = λ · E[S²] / [2(1 − ρ)],其中 ρ = λ · E[S]。式(8)与之完全同形,且分子取 (Tpre)² 相当于把服务时间二阶矩 E[S²] 取为 (E[S])²,即退化为确定性服务时间的 M/D/1 特例。论文将其标注为 M/G/1 近似(引自文献 [8] PLA-Serve 的做法)。这一命名偏宽,结论偏乐观:按上述等价关系,它低估了服务时间波动带来的排队延迟——真实 LLM 的 prefill 长度分布长尾很重,实际排队很可能比这个公式更差。论文用经验安全系数 γ ∈ (0,1] 来吸收这部分近似误差。
把式(8)代入 E[TTFT] ≤ LTTFT,解出 ν 的上界。本文完整推演一遍:
Tpre + ν(Tpre)² / [2(1 − νTpre)] ≤ L
⇔ ν(Tpre)² ≤ 2(L − Tpre) · (1 − νTpre)
⇔ ν[(Tpre)² + 2Tpre(L − Tpre)] ≤ 2(L − Tpre)
⇔ ν ≤ 2(L − Tpre) / [(Tpre)² + 2(L − Tpre)Tpre] = ΛTTFT
与论文式(9)一致(论文另乘安全系数 γ)。式(10)把路由量折算成单副本到达率:
νm,n,t = Σr qr,m,n,t / (ōm · x̃m,n,t · Δt)
把式(10)代入式(9),即可得到式(11)的容量约束。最终的可服务容量约束写成式(11):Σr q ≤ ΛTTFT · ōm · x̃ · Δt,其中 ōm 是平均输出长度,x̃ 是有效就绪副本数。
decode 阶段的约束更简单,也更残酷:每个副本只能跑在最大吞吐 Rmaxm 的一部分上,才能满足 TPOT 限值。论文的建模依据是——其依据的实测(profiling experiments)显示,SLO 合规的吞吐比例在实用运行区间内近似与 TPOT 限值成正比,于是写成式(12):Σr q ≤ (ρTPOTm · LTPOTm) · Rmaxm · x̃ · Δt。
这两条约束合起来说明一件事:副本数不是容量,副本数乘以 SLO 折算系数才是容量。后文的消融实验会证明,忽略这一点会让服务率崩到 56.89%。
论文设置了 3 个数据中心,用美国三个区域的真实节点电价曲线作为电网信号,LLM 请求到达基于真实 OpenAI 负载轨迹(BurstGPT 数据集),代表性负载取 Qwen2.5-32B、Llama-3.3-70B 与 DeepSeek-V3,PUE、模型服务吞吐与 GPU 规格按公开测量或实验结果校准。调度分辨率 15 分钟。
对照方法共六组:B1-Myopic(30 分钟前瞻,无全时段信息)、B2-Static(固定副本布局)、B3-ZeroLeadTime(忽略加载时间)、B4-NoPriceSignal(忽略节点电价差异)、B5-NoTTFT、B6-NoTPOT。其中 B3、B5、B6 是在完整约束下"物理重放"其决策后的结果。
这是阅读本文最需要小心的一处。论文摘要说"总运行成本降低 29.0%",但没有明说分母。本文按表 I 逐项核算:
| 比较基准 | 基准总成本(千美元) | MC 成本(千美元) | 降幅 | 该基准的服务率 |
|---|---|---|---|---|
| B4-NoPriceSignal | 12.56 | 8.92 | 29.0% | 100.00% |
| B2-Static | 21.05 | 8.92 | 57.6% | 97.66% |
| B1-Myopic | 31.32 | 8.92 | 71.5% | 95.43% |
结论:29.0% 的对照对象是 B4-NoPriceSignal,即"同样做到 100% 服务率、但决策时不看节点电价差异"的那个版本。这是最有说服力的一组对照,因为它在服务率这个前置条件上完全可比——两者都是满分,差别纯粹来自价格响应。如果拿 B1 或 B2 做分母,降幅分别是 71.5% 与 57.6%,但那两组的服务率本身就不满,混在一起比较会夸大收益。
论文还给出了一个反向证据,值得单独拎出来:MC 的度电成本是 29.48 美元/109 tokens,高于 B3 的 24.10 与 B5 的 16.77。论文的解释是,MC 服务了远多于它们的需求量,而实现满服务需要在电价更高的站点增加容量,从而抬高了边际电费。
这个细节的含义很重要:单位成本必须与"完成了多少服务"绑定才有意义。B5 的度电成本最低(16.77),代价是服务率只有 56.89%、未服务惩罚高达 204.08 千美元。任何只看单位成本指标的调度评估,都会把这种方案误判为最优。这是评估数据中心需求响应方案时最容易踩的坑。
第一,忽略加载时间是最致命的(B3,服务率 67.40%)。这直接验证了论文的核心主张:空间负载转移必须提前,不能即时。三分之一的请求会因为"目的地没有副本"而落空。
第二,延迟约束比价格信号更影响服务率。忽略 TTFT 约束(B5)服务率掉到 56.89%,是六组里最差的;忽略 TPOT(B6)掉到 78.04%。相比之下,忽略价格信号(B4)不影响服务率,只影响成本。这说明 SLO 约束是可行性的边界,价格信号是经济性的优化空间,两者不在同一个层级。
第三,静态布局(B2)并不安全。它的服务率 97.66% 看起来不差,但度电成本 51.21 美元/109 tokens 是所有方法里最高的,总成本 21.05 千美元是 MC 的 2.36 倍。固定副本布局等于放弃了空间套利,代价最终体现在电费上。
论文 Fig. 2 是全文最值得细读的一张图,它给出了 DeepSeek-V3 在一个昼夜周期内的服务与承诺决策剖面。四条曲线叠在一起看,能读出纯看数值读不出来的东西。
第一层:设施功率比请求曲线平缓得多。论文明确指出,对比论文 Fig. 2 的面板 (a) 与 (b) 可见,设施功率的变化远不如请求曲线陡峭。原因是式(7a)的常驻功率与副本数成正比、与请求量无关——只要副本还驻留在显存里,功率就在那儿。
第二层:MC 会主动"不卸载"。卸载副本能立刻降低功率,但恢复这部分容量需要重新走一遍加载提前期,还要再付一次切换能耗。因此,MC 在需求下降时选择保留一部分常驻容量,而不是反复装卸,结果是在功率曲线上留下一段持续的基底负荷(persistent base load)。
这一段非常关键,值得与电力系统对照着看:机组组合里,调度机构为了避免频繁启停带来的启动成本与机组磨损,会让机组保持在最小出力以上运行,形成"必开机组";MC 里的基底负荷是同一个逻辑的翻版,只不过代价从启动燃料变成了加载能耗与 I/O 占用。换句话说,数据中心的柔性不是免费的,其可下调区间事实上存在一段"不愿轻易释放"的常驻部分。
第三层:动作发生在峰值之前,而不是峰值时刻。论文 Fig. 2 的面板 (c) 与 (d) 显示,尽管请求需求在约 23:00 达到峰值,MC 在约 21:30 就开始重构部署——先在 DC1 和 DC3 加载额外副本,之后才卸载 DC2 的副本。触发这次提前再分配的是两个信号:DC2 的供电短缺,以及 DC2 电价的上涨。图中标注,有 41 个服务组在需求上升前 60 分钟启动加载,与就绪时间 60 分钟(readiness = 60 min)严格对应。
把 60 分钟换算成调度周期:Δt = 15 分钟,Lld = ⌈60/15⌉ = 4。这 41 个服务组的加载决策,是在峰值前整整 4 个调度周期做出的。如果调度系统只有 30 分钟前瞻(B1-Myopic 的设定),它最多只能看到 2 个周期,物理上无法完成这次容量再配置——这正是 B1 服务率停在 95.43% 的机制性原因,而不是它不够聪明。
MC 这类方法改变的不是某一台设备的效率,而是价值在产业链上的落点。
| 环节 | 在 MC 框架下的角色 | 价值影响 |
|---|---|---|
| AI 加速卡 | 容量上限 An,t 与显存 Gn,t 的物理来源 | 总量约束者。优化空间的上限由它决定,本身不因 MC 增值 |
| 服务器 / 机柜 | 单副本 GPU 数 am,n 的载体 | 中性。密度提升降低常驻功耗 pidle,间接放大优化空间 |
| 数据中心(单站点) | 提供 PUEn 与供电上限 P̄n,t | 相对受损方。若无法参与跨区协同,只能停留在 B2-Static 位置——度电成本 51.21 美元/109 tokens,是六组中最高的 |
| 跨区编排与调度软件 | 求解式(1)至式(12) 的能力载体 | 主要增值方。29.0% 的成本差主要由这一层实现 |
| 多站点运营商 | 同时持有 DC1/DC2/DC3 的调度权 | 主要增值方。提前期的存在使得"跨站点调度权"成为稀缺资产 |
| 电力系统 / 需求响应市场 | 提供 λn,t 与 P̄n,t 信号 | 受益方。MC 把数据中心从"瞬时可压的负荷"变成"可提前承诺的资源",可报价性显著提升 |
利润池的规模可以直接从表 I 读出来。MC 的总成本 8.92 千美元中,未服务惩罚为 0,即全部成本都是电费;度电成本 29.48 美元/109 tokens,对照 B4 的 41.53,节约 12.05 美元/109 tokens。这就是"编排能力"这一层所对应的价值池规模(本文按论文算例口径折算)——它不包含硬件销售,也不包含机房租赁,纯粹是运营成本的节约。
分配逻辑因此很清楚:价值从"单站点的能效与电价谈判"转移到"跨站点的时序编排"。一个只拥有一座机房的业主,无论 PUE 做得多低,都无法分享这部分价值;而一个同时运营多个地理站点的运营商,即使单站效率平庸,也能靠时序套利拿到成本优势。MC 事实上在给"跨区运营能力"定价。
口径一:加速卡供给,CR1 > 80%。按公开市场研究口径,数据中心 AI 加速卡市场高度集中,头部厂商份额长期在 80% 以上。这是公开口径,非本文实测。其含义是:MC 的全部优化都发生在式(6)给定的容量上限之内,而这个上限本身由单一供给源决定——约束的天花板握在别人手里。
口径二:算力增量的空间集中度,2.18 倍。这是有硬数据的量化。全国一体化算力网络 8 大枢纽节点的算力用电近 3 年平均增长率约 39.5%,而同期全国算力中心总用电增速为 18.1%(信通院 2025 年口径)。两者之比 39.5 / 18.1 ≈ 2.18,说明新增算力正在向枢纽节点集中。与国家枢纽节点新建数据中心绿电消费比例统一为 80% 这条要求叠加,意味着算力增量与绿电合规约束在空间上是重合的——最需要转移灵活性的地方,恰恰是合规约束最紧的地方。
口径三:算例内的容量集中度,主动下降。MC 在算例中把容量从 DC2(供电短缺且电价上涨)迁往 DC1 与 DC3。这是一个动态视角下的集中度变化:最优解不是把容量堆在最便宜的地方,而是在供电约束与价格之间做时序权衡。若只看成本最低化,容量会向低电价站点集中;加入供电上限后,集中度反而被主动压低。
本节测算的是"可被空间转移的算力负荷"规模,即 MC 这类方法在中国语境下的理论作用空间。需要明确:可转移比例与价差均为本文假设,非实测值。
| 情景 | 可转移比例假设 | 2025 年(1700 亿千瓦时基数) | 2030 年(8000 亿千瓦时基数) | 按 0.1 元/千瓦时价差计的节约 |
|---|---|---|---|---|
| 低情景 | 5% | 85 亿千瓦时 | 400 亿千瓦时 | 8.5 亿元 / 年(2030:40 亿元) |
| 中情景 | 15% | 255 亿千瓦时 | 1200 亿千瓦时 | 25.5 亿元 / 年(2030:120 亿元) |
| 高情景 | 30% | 510 亿千瓦时 | 2400 亿千瓦时 | 51.0 亿元 / 年(2030:240 亿元) |
价格敏感性很直接:价差取 0.05 元/千瓦时时,三档节约减半(4.3 / 12.8 / 25.5 亿元);取 0.2 元/千瓦时时翻倍(17.0 / 51.0 / 102.0 亿元)。价差与可转移比例对节约规模的影响是一次方同权的——两者各减半,节约同样减半。但实践中价差的波动幅度通常远大于比例的不确定性,因此价差是更需要盯住的那个变量。
与现实的对照,才是这张表真正要说明的东西。2026 年中国算力大会期间披露的实测数据:国网廊坊供电公司通过跨区域算力负荷转移试点,完成廊坊至张家口的 1.5 兆瓦负荷转移;在度夏算电协同试验中,组织 29 家数据中心参与,压降负荷约 4 兆瓦。
本文把 4 兆瓦按全年持续折算,约为 0.35 亿千瓦时/年(4 MW × 8760 h = 3504 万千瓦时)。低情景的 85 亿千瓦时是它的约 243 倍,高情景的 510 亿千瓦时是约 1455 倍。理论空间与已实现规模之间,隔着两个到三个数量级。需要说明,试点量级是瞬时功率而非全年持续电量,此处折算仅为量级参照。
风险一:加速卡供给的物理天花板。CR1 > 80% 的供给集中度意味着,一旦供给端出现产能或贸易约束,式(6)的 An,t 与 Gn,t 直接收紧,MC 的优化空间随之缩小,且没有任何算法层面的补救手段。
风险二:模型越大,算力越不灵活。这是本文从式(3b)推出的最重要的一条推论。加载提前期 Lld = ⌈Trd/Δt⌉ 与就绪时间成正比。以 Δt = 15 分钟计:Trd = 10 分钟时 Lld = 1;Trd = 60 分钟时 Lld = 4。模型体量每上一个台阶,就绪时间变长,提前期变长,可响应窗口变窄。
但本文进一步认为,就绪时间的主体可能不是 I/O。按 BF16(2 字节/参数)粗算,Qwen2.5-32B 权重约 64 GB、Llama-3.3-70B 约 140 GB、DeepSeek-V3 按 671B 参数计约 1342 GB(此处的体量为按参数量 × 2 字节粗算,实际部署因量化与并行切分而不同)。即便按本文假设的 3 GB/s 单机存储读带宽计,64 GB 约需 21 秒、1342 GB 约需 7.5 分钟——都远小于论文算例中的 60 分钟。因此本文推断,60 分钟里的绝大部分是预热:CUDA kernel 编译、显存池分配、KV cache 预分配、CUDA graph 捕获与批处理校准。论文原文的表述是 "loading and warming up these replicas require substantial time",与该推断方向一致,但论文未对两者做拆分,此为本文推演。
这条推论的工程含义很实在:缩短就绪时间的抓手在预热流水线化与常驻热备池,而不在更快的存储。把存储带宽再翻一倍,可能只省下几十秒;而把预热过程做成可复用、可并行的流水线,动的是几十分钟的量级。
风险三:网络与 I/O 带宽。跨站点路由带宽约束与数据中心 I/O 约束在论文中引自文献 [6] 与 [7],正文中省略了具体形式,本文未做复现。这两条约束在大规模部署时会成为实际瓶颈:跨区转移的是请求流量,加载转移的是模型权重,两者争抢的可能是同一条骨干网。
风险四:电力接入的硬约束。式(7d)的 P̄n,t 是外部给定的供电上限,PUEn 是乘数。在中国语境下,数据中心并网容量本身就是稀缺资源;MC 只能在给定的功率天花板内做时序优化,无法凭空创造容量。
风险五:价格信号的可用性。论文用美国三个区域的真实节点电价作为空间信号。中国的省级现货市场在价格颗粒度、分区方式与跨省价格信号的可获取性上与之不同,且跨省算力转移还涉及省间市场壁垒。价格信号缺失或被行政区划截断时,MC 的目标函数(式 2)就只剩下第一项在起作用,优化退化为"尽量不丢请求",空间套利的部分全部失效。
把论文的算例尺度与中国现实并排放,差距一目了然。论文是 3 个数据中心、百兆瓦量级的 DeepSeek-V3 功率剖面;中国已公开的跨区算力负荷转移试点是 1.5 兆瓦与 4 兆瓦。这中间差的不是算法,而是三件基础设施。
第一件:可预期的跨省价格与供电约束信号。MC 之所以能在需求峰值(论文读数约 23:00)之前约 90 分钟(约 21:30)做出正确的容量再配置决策,前提是全时段的价格与供电上限是已知输入。中国的调度体系能否为数据中心提供这样一条提前发布、跨省可比的信号,决定了这类方法能不能落地。
第二件:跨省算力的统一调度权。论文假设一个运营商同时调度 DC1、DC2、DC3。现实中的"东数西算"跨越了不同省份、不同运营主体的园区。廊坊至张家口的 1.5 兆瓦试点之所以是新闻,恰恰因为跨行政区的调度权协调本身就是难点。
第三件:绿电核算主体的归属规则。这是一个本文提出的、目前政策尚未明确的问题。42 号令下,重点用能行业可再生能源电力消费最低比重目标按"用能主体"核算,国家枢纽节点新建数据中心的比例为 80%。如果一笔推理请求从东部转移到西部的数据中心执行,那么这度电的绿电消费算东部需求方的,还是西部承载方的?按附件 2 的口径,自发自用电量计入"该用能主体"、绿电直连电量计入"项目用能主体"——本文推断,这两个主体在跨省算力转移场景下并不重合,但目前无明文规则可依据。在没有明确规则之前,跨区算力转移的绿电账本是记不清的。
另一方面,中国的推进路径也有自己的特色。国家能源局提出的思路是"以电强算、以算促电",明确要"统筹通算、智算、超算等不同类型算力设施用电特性和调节潜力,优化算力负荷安排",并"以电力时空价格信号为指引引导其主动适应系统调节需求"。这句话的内核与 MC 完全一致——区别只在于,MC 给出了实现它所需的具体约束结构。
论文层面的局限。其一,这是一篇 3 页的 letter,算例规模为 3 个数据中心、3 个模型,未做大规模系统验证或真实部署验证。其二,完整的参数设置在论文中未给出,指向外部代码仓库的参数配置文件,本文因此无法独立复核 PUE、模型服务吞吐与 GPU 规格等取值。其三,论文只处理推理负载,未涉及训练负载——训练任务的中断代价、检查点机制与可迁移性与推理完全不同,不能套用同一套结论。其四,排队模型用的是均值近似,式(8)在数学上退化为 M/D/1 特例,γ 为经验校准系数,对长尾分布的实际覆盖能力未经验证。其五,价格与场景取自美国三个区域,与中国市场结构差异较大。其六,论文只取 15 分钟单一分辨率,未讨论更短分辨率下加载提前期的粒度损失。
本文推演层面的局限。其一,三档情景中的可转移比例(5% / 15% / 30%)与跨区价差(0.1 元/千瓦时)均为本文假设,没有实测支撑,只应用于量级判断。其二,模型权重体量为按参数量 × 2 字节(BF16)粗算,实际部署因量化、张量并行与 MoE 稀疏激活而差异很大。其三,"60 分钟就绪时间中预热占主体"是本文基于数据量级的推断,论文未做拆分。其四,CR1 > 80% 为公开市场研究口径,非本文实测。其五,4 兆瓦试点按全年持续折算为 0.35 亿千瓦时,属量级参照而非实际年电量。
这篇 3 页的 letter 做的是一件很小但很关键的事:它指出"把算力搬走"这句话在工程上不是一个瞬时动作,而是一个需要提前承诺的过程,然后把这个过程的约束结构完整地写了出来。
三条结论。第一,空间负载转移不是一个调度问题,而是一个承诺问题。谁想让算力可调度,谁就必须先把算力变成可承诺的——也就是提前把模型副本放到该在的地方。忽略这一点,服务率会从 100% 掉到 67.40%。
第二,29.0% 与 100% 是两件不同的事,不能混着说。29.0% 的成本下降来自价格响应(对照 B4,两者服务率同为 100%);而从 95.43% 到 100% 的那一截服务率提升来自提前期建模。前者是经济性优化,后者是可行性突破。评估任何数据中心需求响应方案时,都必须先固定服务率再比成本,否则会得出方向相反的结论——B5 的度电成本最低(16.77),服务率却只有 56.89%。
第三,数据中心的柔性不是免费的,它有固定的"最小出力"。MC 在需求下降时保留副本而非反复装卸,在功率曲线上留下持续基底负荷,这与机组组合为避免频繁启停而保留最小出力是同一个逻辑。对电力系统而言,这意味着数据中心作为需求响应资源,其可调节区间是"上限之下、基底之上"的那一段,而不是从零到额定。
对中国而言,最值得记住的一句话是:算电协同的瓶颈,不是"愿不愿意调",而是"能不能提前 60 分钟知道要调"。前者是意愿问题,后者是基础设施问题。廊坊到张家口那 1.5 兆瓦的试点之所以重要,不在于规模,而在于它验证了跨行政区的调度权是可以打通的——这一步走过之后,剩下的才是算法与信号的事。
| 观察指标 | 当前基准 | 读数含义 |
|---|---|---|
| 跨区算力负荷转移实测规模 | 廊坊—张家口 1.5 MW;度夏试验压降 4 MW | 若持续停留在兆瓦级,说明调度权与信号仍是瓶颈 |
| 省级现货价格信号的颗粒度与跨省可比性 | 各省现货市场建设进度不一 | 决定 MC 目标函数第二项能否真正起作用 |
| 大模型副本就绪时间 Trd 的实测值 | 论文算例取 60 分钟 | 决定 Lld 与所需提前期;值越大,可响应窗口越窄 |
| 万卡级智算集群数量与枢纽用电增速 | 42 个;枢纽节点近 3 年年均 39.5% | 增量集中度越高,跨区转移的价值越大 |
| 跨省算力转移的绿电核算归属规则 | 政策未明确 | 规则落地前,转移的绿电账本记不清,合规路径不通 |
最后回到方法本身。MC 的骨架是混合整数线性规划,求解难度随站点数、模型数与时段数快速增长,论文为此开发了 fix-and-re-optimize 算法来保证实时性并防止同时充放(该算法为论文自述,本文未独立验算其求解性能)——这又是一个从储能调度里借来的手法。电力系统用了四十年积累的机组组合工具箱,正在被数据中心一项一项地借走。这一次借走的是"承诺",下一次可能是"备用",再下一次也许是"容量市场"。对电力行业的人来说,这不失为一个提醒:那些被当作成熟甚至过时的工具,正在另一个行业里变成前沿。
免责声明:本文为公开信息整理与分析,观点仅供参考,不构成投资建议。数据以官方原始发布为准。