← 返回深度文章归档

算力也得“机组组合”:Model Commitment 的 60 分钟提前量、29.0% 成本差与被忽略的排队约束

深度 · tech · 2026-10-04 · NewdPower 研究 · 阅读约 22 分钟 · 万字深度+行业分析

一、论文信息卡与导读

项目内容
标题Spatial LLM Workload Shifting Needs Foresight: Model Commitment for AI Data Center Operation under Power Grid Constraints
作者Bojun Du、Hongyang Jia、Tonghui Li、Qingchun Hou、Ze Wang、Ershun Du、Ning Zhang
单位清华大学电机工程与应用电子技术系(B. Du、H. Jia、E. Du、N. Zhang);浙江大学 ZJU-UIUC Institute(Q. Hou);中国大唐集团科技创新有限公司(T. Li、Z. Wang)
版本arXiv:2609.09787v1 [eess.SY],2026 年 9 月 9 日提交;3 页、2 图(letter)
问题AI 数据中心在部分时段面临供电短缺,需把 LLM 推理负载在空间上转移;现有方法假设任何有算力的数据中心都能立即服务被转移的请求
方法Model Commitment(MC)——混合整数线性规划,联合调度模型部署与跨站点请求路由
结果100% 请求服务率;相对无价格信号基线(B4,同为 100% 服务率)总运行成本下降 29.0%

论文切入的角度值得单独说一句。过去两年,"算电协同"这个方向上的多数工作把数据中心当成一个可调度的柔性负荷——给它一个功率上限,让它自己想办法压下去。这类模型隐含一个假设:算力是可以瞬时、自由地在空间上搬动的资源。

论文作者团队否认这个假设,理由很具体:一个 LLM 推理请求,只能被送到已经加载了对应模型副本的那个数据中心。副本不是凭空存在的,把一个 32B 或 70B 量级的模型装进 GPU 显存并完成预热,需要几十分钟量级的时间。因此"现在决定把算力搬到另一个州"这句话,在工程上是不成立的——你必须在几十分钟前就做出决定。

于是,电力系统里那个最经典的难题被搬进了数据中心:机组组合(Unit Commitment, UC)。机组不能说开就开,要提前开机、要最小启停时间、要付启动成本;模型副本不能说装就装,要提前加载、要加载提前期、要付加载能耗与 I/O 占用。论文把这个对应关系写成了显式约束,并给它起了个名字——模型承诺(Model Commitment)。

现代数据中心机房冷通道,两侧黑色机柜列透出蓝绿色状态指示灯
图 1 · 数据中心机房冷通道:模型副本必须常驻在 GPU 显存中,才能接受被转移过来的请求(NewdPower 绘制)

二、问题建模:三分法与目标函数

MC 从数据中心运营商的视角建模,调度分辨率取 15 分钟,输入是请求需求、供电上限与节点电价,输出是每个数据中心上模型副本的常驻状态,以及请求在各站点之间的空间路由。

2.1 需求分解:服务的、没服务的

式(1)把所有请求需求切成两部分:

Σn qr,m,n,t + sr,m,t = Dr,m,t

其中 r 是需求区域、m 是模型类型、n 是数据中心、t 是时段;q 是路由到数据中心 n 的 token 量,s 是未服务的 token 量。这个式子的意义在于:它把"服务不了"变成了一个有价格的变量,而不是一个不可行的约束。这是需求响应建模里最常见的处理手法——和电力系统里"失负荷"被赋予 VOLL(失负荷价值)是同一个思路。

2.2 目标函数:两笔钱的对冲

min Σr,m,t πm · sr,m,t + Σn,t λn,t · Pfacn,t · Δt

第一项是未服务 token 的经济损失(πm 为单位损失),第二项是电费(λn,t 为节点电价,Pfacn,t 为设施功率)。这两项天然对冲:把请求送到电价低的站点能省电费,但如果那个站点没有足够的已加载副本,就会产生未服务惩罚。MC 的全部优化张力,就在这两项之间。

MC 五层机制:从输入到目标,时际耦合只发生在第二层 机制框图。依据论文第二节式(1)至式(12)绘制(NewdPower 绘制) ① 输入层 请求需求 D · 供电上限 P̄ · 节点电价 λ(15 分钟分辨率) 外部给定 ② 承诺层:副本常驻状态演进 x = x(t−1) + y(t−L) − z(t);加载与卸载互斥 式(3)(4)(5) ③ 资源与功率约束层 GPU 卡数 · 显存(权重+KV cache)· PUE 折算设施功率上限 式(6)(7) ④ 空间路由层 q 受 TTFT 排队容量与 TPOT 吞吐容量双重上限约束 式(1)(11)(12) ⑤ 目标层 min 未服务惩罚 π·s + 电费 λ·P·Δt 式(2) 关键结构:时际耦合只在第②层(跨时段状态演进),其余四层均为同时段约束;这是 MC 与"纯空间调度"模型的分界线。
图 2 · Model Commitment 的五层机制结构(NewdPower 绘制)

三、时际承诺:Lld 与 η 的物理含义

式(3)是全文的技术核心。先看三个变量的角色:ym,n,t 是在 t 时段发起加载的模型 m 副本数,zm,n,t 是卸载数,xm,n,t 是在时段 t 全程服务就绪的副本数。

xm,n,t = xm,n,t−1 + ym,n,t−L − zm,n,t · Lld = max(1, ⌈Trd / Δt⌉) · ηld = Lld − Trd / Δt

这里 Trd 是物理就绪时间,Lld 是把它折算成的整数调度周期数。第三项 ηld 最容易被读错,它出现在式(3c):

x̃m,n,t = xm,n,t + ηldm,n · ym,n,t−L+1

本文做了三组验算,确认它的物理含义:η 是在 t−L+1 时段发起加载的那一批副本,在 t 时段内能够提供服务的时长比例。

物理就绪时间 TrdΔtLldηld物理含义(本文验算)
10 分钟(论文举例)15 分钟max(1, ⌈0.667⌉) = 11 − 0.667 = 0.333t(= t−L+1)当期发起,10 分钟即完成,当期剩余 5 分钟可服务,比例 5/15 = 1/3
40 分钟15 分钟⌈2.667⌉ = 33 − 2.667 = 0.333t−2(= t−L+1)发起,40 分钟后在 t 时段开始后 10 分钟完成,当期可服务 5/15 = 1/3
60 分钟(论文算例)15 分钟⌈4⌉ = 44 − 4.000 = 0t−3(= t−L+1)发起的一批恰在 t 时段末完成,当期可服务时长为 0,故无部分贡献

三组验算与 η = L − Trd/Δt 完全吻合,说明式(3c)做的是一件很朴素的事:把"跨周期的加载进度"折算成"当期的等效可用副本数"。它的一般形式是可服务时长 = L·Δt − Trd,除以 Δt 即为 η。

η = (Lld·Δt − Trd) / Δt = Lld − Trd / Δt

式(4)处理一个工程细节:同一个模型在同一时段不能既加载又卸载,用 0/1 指示变量 δ 加大 M 法实现:

ym,n,t ≤ M · δm,n,t · zm,n,t ≤ M · (1 − δm,n,t)

式(5)则定义了 ℓm,n,t——正在加载中的副本数,即最近 L 个周期内发起、尚未就绪的加载批次之和:

ℓm,n,t = Σk=0..L−1 ym,n,t−k

它们还没进 x(不能服务),但已经占了 GPU 和显存。这个处理很关键,因为它意味着"加载"这个动作本身是有资源成本的。

以 T(rd) = 60 分钟、Δt = 15 分钟为例:两批副本的五个调度周期 时序状态图。时间格宽度不参与比较,横轴为等间隔时段(NewdPower 绘制) 批次 A:在 t−4 发起加载(式 3a:y(t−L) → x(t)) t−4 发起加载 y t−3 加载中 ℓ t−2 加载中 ℓ t−1 加载中 ℓ t 整周期就绪 x 批次 B:在 t−3 发起加载(式 3c:η · y(t−L+1)) t−4 尚未发起 t−3 发起加载 y t−2 加载中 ℓ t−1 加载中 ℓ t 期末完成 η = 0 本文验算(η = L − T(rd)/Δt,批次索引为 t−L+1) T(rd) = 10 min → L = max(1, ⌈0.667⌉) = 1,η = 1 − 0.667 = 0.333 T(rd) = 40 min → L = ⌈2.667⌉ = 3,η = 3 − 2.667 = 0.333(t−2 发起) T(rd) = 60 min → L = 4,η = 0(t−3 发起) 该批次恰在 t 时段末完成,当期可服务时长为 0 即论文算例:就绪时间 60 分钟 = 4 个 15 分钟调度周期 式(3a) 全程就绪来自 t−L 发起的批次;式(3c) 补上 t−L+1 发起批次在当期的部分贡献,相加即 x̃。 本文读数:60 分钟就绪时间 = 4 个 15 分钟周期,决策须比需求峰值提前至少 4 个调度周期做出。
图 3 · 副本加载的时序状态机与提前期折算(NewdPower 绘制)

四、一张类比表:MC 就是数据中心里的机组组合

把 MC 的约束结构与机组组合逐项对照,会发现这不是比喻,而是同构。论文自己也点明了这一点——"类似于机组组合中的机组启动"(similar to generator start-up in UC)。

同构而非比喻:机组组合与模型承诺的逐项对照 对照框图。左列机组组合,右列论文 MC(NewdPower 绘制) 机组组合 UC 模型承诺 MC 机组 i(发电机) 模型副本 / 服务组(模型 m,站点 n) ≙ 启停状态 u(i,t) 常驻状态 x(m,n,t) ≙ 启动动作 v / 停机动作 w 加载 y / 卸载 z(式 4 互斥) ≙ 最小启停时间 T(on) / T(off) 加载提前期 L(ld) = ⌈T(rd)/Δt⌉(式 3b) ≙ 启动成本(燃料 + 机组磨损) 加载能耗 E(ld) / 卸载能耗 E(ul)(式 7c) ≙ 爬坡约束 / 出力上下限 GPU 卡数与显存容量(式 6) ≙ 失负荷惩罚 VOLL 未服务 token 惩罚 π(m)(式 2) ≙ 节点边际电价 LMP 节点电价 λ(n,t)(式 2) ≙ 一处结构性差异:UC 启动成本只影响经济性,MC 加载还直接占用 GPU 与显存(式 5、式 6)。 另一处差异:UC 备用可由未开机机组提供,MC 的 SLO 余量由安全系数 γ 内嵌于容量上限(式 9)。
图 4 · 机组组合与模型承诺的逐项类比(NewdPower 绘制)

五、资源约束与功率方程

式(6)给的是算力侧的硬约束。GPU 卡数约束为 Σm am,n · (xm,n,t + ℓm,n,t) ≤ An,t;显存约束为 Σm (gm + κm) · (xm,n,t + ℓm,n,t) ≤ Gn,t,其中 gm 是模型权重显存、κm 是每副本预留的 KV cache 显存。两式都把加载中的副本算进占用,这是对的——加载过程必须先在显存里把权重铺开。

式(7)把算力翻译成电力。设施功率拆成三项:

功率分量表达式物理含义
常驻功率 PidleΣm pidlem,n · (x + ℓ)副本常驻显存时的基础功耗,与是否处理请求无关
推理功率 Pinf(1/Δt) · Σr,m em,n · q按每输出 token 的增量电能折算,由路由量决定
切换功率 Psw(1/Δt) · Σm (Eld · y + Eul · z)加载与卸载动作的能耗,即"启动成本"的电力表达
设施功率 PfacPUEn · (Pidle + Pinf + Psw) ≤ P̄n,t乘 PUE 后受需求响应事件的功率上限约束

这里有两个值得强调的结构。第一,Pidle 与副本数成正比,与请求量无关。这意味着常驻副本本身就是一笔固定的电力账单——正是这个性质让"要不要保留一个副本"变成一个真正的启停决策,而不是免费的。第二,约束 P̄n,t 是分时段的供电上限,直接对应需求响应事件。论文的模型里,数据中心不是在"响应价格",而是在"响应价格 + 供电可用性"两个信号。

六、SLO 建模:排队论如何变成容量约束

这是论文第二个贡献,也是被工程实践低估最深的一块。一个副本就算加载好了,能接多少请求也不是无限的——它受延迟约束。论文把两段延迟分别折算成容量上限。

6.1 prefill 段:M/G/1 排队与 TTFT

分配给一个副本的请求共享它的服务队列。论文用 M/G/1 近似给出单副本的平均 TTFT:

E[TTFT] = Tpre + ν · (Tpre)² / [ 2 (1 − ν · Tpre) ]

其中 ν 是分配到单副本的请求到达率,Tpre 是平均 prefill 服务时间。本文对照排队论的标准形式做一步核对:Pollaczek–Khinchine 平均等待时间公式为 Wq = λ · E[S²] / [2(1 − ρ)],其中 ρ = λ · E[S]。式(8)与之完全同形,且分子取 (Tpre)² 相当于把服务时间二阶矩 E[S²] 取为 (E[S])²,即退化为确定性服务时间的 M/D/1 特例。论文将其标注为 M/G/1 近似(引自文献 [8] PLA-Serve 的做法)。这一命名偏宽,结论偏乐观:按上述等价关系,它低估了服务时间波动带来的排队延迟——真实 LLM 的 prefill 长度分布长尾很重,实际排队很可能比这个公式更差。论文用经验安全系数 γ ∈ (0,1] 来吸收这部分近似误差。

把式(8)代入 E[TTFT] ≤ LTTFT,解出 ν 的上界。本文完整推演一遍:

Tpre + ν(Tpre)² / [2(1 − νTpre)] ≤ L
⇔ ν(Tpre)² ≤ 2(L − Tpre) · (1 − νTpre)
⇔ ν[(Tpre)² + 2Tpre(L − Tpre)] ≤ 2(L − Tpre)
⇔ ν ≤ 2(L − Tpre) / [(Tpre)² + 2(L − Tpre)Tpre] = ΛTTFT

与论文式(9)一致(论文另乘安全系数 γ)。式(10)把路由量折算成单副本到达率:

νm,n,t = Σr qr,m,n,t / (ōm · x̃m,n,t · Δt)

把式(10)代入式(9),即可得到式(11)的容量约束。最终的可服务容量约束写成式(11):Σr q ≤ ΛTTFT · ōm · x̃ · Δt,其中 ōm 是平均输出长度,x̃ 是有效就绪副本数。

排队曲线:到达率逼近 1/T(pre) 时,TTFT 发散 取 T(pre) = 0.4 s、L(TTFT) = 2.0 s。纵轴 31.667 px/秒,横轴 216 px/(请求/秒)(NewdPower 绘制) 0 1 2 3 4 5 6 L(TTFT) = 2.0 s ν = 1/T(pre) = 2.5,发散点 γ=1: 2.22 γ = 0.9 → ν ≤ 2.00 E[TTFT] = 1.20 s 0 0.5 1.0 1.5 2.0 2.5 单副本请求到达率 ν(请求/秒) 本文验算:γ = 1 时 Λ = 2.22 请求/秒,ρ = 0.889,代回式(8) 得 E[TTFT] = 2.00 s,恰好触及限值。 γ = 0.9 时 Λ = 2.00 请求/秒,ρ = 0.80,E[TTFT] = 1.20 s,预留 0.80 s 余量。
图 5 · 单副本到达率与平均 TTFT 的排队曲线(NewdPower 绘制)

6.2 decode 段:TPOT 与吞吐折损

decode 阶段的约束更简单,也更残酷:每个副本只能跑在最大吞吐 Rmaxm 的一部分上,才能满足 TPOT 限值。论文的建模依据是——其依据的实测(profiling experiments)显示,SLO 合规的吞吐比例在实用运行区间内近似与 TPOT 限值成正比,于是写成式(12):Σr q ≤ (ρTPOTm · LTPOTm) · Rmaxm · x̃ · Δt。

这两条约束合起来说明一件事:副本数不是容量,副本数乘以 SLO 折算系数才是容量。后文的消融实验会证明,忽略这一点会让服务率崩到 56.89%。

七、算例与六组对照:29.0% 到底是哪个 29.0%

论文设置了 3 个数据中心,用美国三个区域的真实节点电价曲线作为电网信号,LLM 请求到达基于真实 OpenAI 负载轨迹(BurstGPT 数据集),代表性负载取 Qwen2.5-32B、Llama-3.3-70B 与 DeepSeek-V3,PUE、模型服务吞吐与 GPU 规格按公开测量或实验结果校准。调度分辨率 15 分钟。

对照方法共六组:B1-Myopic(30 分钟前瞻,无全时段信息)、B2-Static(固定副本布局)、B3-ZeroLeadTime(忽略加载时间)、B4-NoPriceSignal(忽略节点电价差异)、B5-NoTTFT、B6-NoTPOT。其中 B3、B5、B6 是在完整约束下"物理重放"其决策后的结果。

服务率与总成本:MC 在两个指标上同时最优 上:服务率(1.00 px/%);下:总成本(0.7143 px/千美元)。数据源:论文表 I(NewdPower 绘制) 0 50 100 95.43 97.66 67.40 100 56.89 78.04 100 B1 B2 B3 B4 B5 B6 MC 0 100 200 31.32 21.05 134.85 12.56 206.97 61.15 8.92 上半:服务率(%);下半:总成本(千美元)。B1 30分钟前瞻 · B2 固定布局 · B3 忽略加载时间 · B4 忽略节点电价 · B5 忽略 TTFT · B6 忽略 TPOT · MC 为本文方法 口径澄清(本文核算):29.0% 降幅对应 MC 总成本 8.92 对 B4 的 12.56,即 (12.56 − 8.92) / 12.56 = 29.0%。
图 6 · 六种对照方法与 MC 的服务率、总成本对比(NewdPower 绘制)

7.1 口径辨析:29.0% 的分母是谁

这是阅读本文最需要小心的一处。论文摘要说"总运行成本降低 29.0%",但没有明说分母。本文按表 I 逐项核算:

比较基准基准总成本(千美元)MC 成本(千美元)降幅该基准的服务率
B4-NoPriceSignal12.568.9229.0%100.00%
B2-Static21.058.9257.6%97.66%
B1-Myopic31.328.9271.5%95.43%

结论:29.0% 的对照对象是 B4-NoPriceSignal,即"同样做到 100% 服务率、但决策时不看节点电价差异"的那个版本。这是最有说服力的一组对照,因为它在服务率这个前置条件上完全可比——两者都是满分,差别纯粹来自价格响应。如果拿 B1 或 B2 做分母,降幅分别是 71.5% 与 57.6%,但那两组的服务率本身就不满,混在一起比较会夸大收益。

论文还给出了一个反向证据,值得单独拎出来:MC 的度电成本是 29.48 美元/109 tokens,高于 B3 的 24.10 与 B5 的 16.77。论文的解释是,MC 服务了远多于它们的需求量,而实现满服务需要在电价更高的站点增加容量,从而抬高了边际电费。

这个细节的含义很重要:单位成本必须与"完成了多少服务"绑定才有意义。B5 的度电成本最低(16.77),代价是服务率只有 56.89%、未服务惩罚高达 204.08 千美元。任何只看单位成本指标的调度评估,都会把这种方案误判为最优。这是评估数据中心需求响应方案时最容易踩的坑。

7.2 消融实验告诉我们的三件事

第一,忽略加载时间是最致命的(B3,服务率 67.40%)。这直接验证了论文的核心主张:空间负载转移必须提前,不能即时。三分之一的请求会因为"目的地没有副本"而落空。

第二,延迟约束比价格信号更影响服务率。忽略 TTFT 约束(B5)服务率掉到 56.89%,是六组里最差的;忽略 TPOT(B6)掉到 78.04%。相比之下,忽略价格信号(B4)不影响服务率,只影响成本。这说明 SLO 约束是可行性的边界,价格信号是经济性的优化空间,两者不在同一个层级。

第三,静态布局(B2)并不安全。它的服务率 97.66% 看起来不差,但度电成本 51.21 美元/109 tokens 是所有方法里最高的,总成本 21.05 千美元是 MC 的 2.36 倍。固定副本布局等于放弃了空间套利,代价最终体现在电费上。

八、时序剖面:提前 60 分钟的那一步

论文 Fig. 2 是全文最值得细读的一张图,它给出了 DeepSeek-V3 在一个昼夜周期内的服务与承诺决策剖面。四条曲线叠在一起看,能读出纯看数值读不出来的东西。

第一层:设施功率比请求曲线平缓得多。论文明确指出,对比论文 Fig. 2 的面板 (a) 与 (b) 可见,设施功率的变化远不如请求曲线陡峭。原因是式(7a)的常驻功率与副本数成正比、与请求量无关——只要副本还驻留在显存里,功率就在那儿。

第二层:MC 会主动"不卸载"。卸载副本能立刻降低功率,但恢复这部分容量需要重新走一遍加载提前期,还要再付一次切换能耗。因此,MC 在需求下降时选择保留一部分常驻容量,而不是反复装卸,结果是在功率曲线上留下一段持续的基底负荷(persistent base load)。

这一段非常关键,值得与电力系统对照着看:机组组合里,调度机构为了避免频繁启停带来的启动成本与机组磨损,会让机组保持在最小出力以上运行,形成"必开机组";MC 里的基底负荷是同一个逻辑的翻版,只不过代价从启动燃料变成了加载能耗与 I/O 占用。换句话说,数据中心的柔性不是免费的,其可下调区间事实上存在一段"不愿轻易释放"的常驻部分。

第三层:动作发生在峰值之前,而不是峰值时刻。论文 Fig. 2 的面板 (c) 与 (d) 显示,尽管请求需求在约 23:00 达到峰值,MC 在约 21:30 就开始重构部署——先在 DC1 和 DC3 加载额外副本,之后才卸载 DC2 的副本。触发这次提前再分配的是两个信号:DC2 的供电短缺,以及 DC2 电价的上涨。图中标注,有 41 个服务组在需求上升前 60 分钟启动加载,与就绪时间 60 分钟(readiness = 60 min)严格对应。

把 60 分钟换算成调度周期:Δt = 15 分钟,Lld = ⌈60/15⌉ = 4。这 41 个服务组的加载决策,是在峰值前整整 4 个调度周期做出的。如果调度系统只有 30 分钟前瞻(B1-Myopic 的设定),它最多只能看到 2 个周期,物理上无法完成这次容量再配置——这正是 B1 服务率停在 95.43% 的机制性原因,而不是它不够聪明。

九、产业链价值链与利润池

MC 这类方法改变的不是某一台设备的效率,而是价值在产业链上的落点。

环节在 MC 框架下的角色价值影响
AI 加速卡容量上限 An,t 与显存 Gn,t 的物理来源总量约束者。优化空间的上限由它决定,本身不因 MC 增值
服务器 / 机柜单副本 GPU 数 am,n 的载体中性。密度提升降低常驻功耗 pidle,间接放大优化空间
数据中心(单站点)提供 PUEn 与供电上限 P̄n,t相对受损方。若无法参与跨区协同,只能停留在 B2-Static 位置——度电成本 51.21 美元/109 tokens,是六组中最高的
跨区编排与调度软件求解式(1)至式(12) 的能力载体主要增值方。29.0% 的成本差主要由这一层实现
多站点运营商同时持有 DC1/DC2/DC3 的调度权主要增值方。提前期的存在使得"跨站点调度权"成为稀缺资产
电力系统 / 需求响应市场提供 λn,t 与 P̄n,t 信号受益方。MC 把数据中心从"瞬时可压的负荷"变成"可提前承诺的资源",可报价性显著提升

利润池的规模可以直接从表 I 读出来。MC 的总成本 8.92 千美元中,未服务惩罚为 0,即全部成本都是电费;度电成本 29.48 美元/109 tokens,对照 B4 的 41.53,节约 12.05 美元/109 tokens。这就是"编排能力"这一层所对应的价值池规模(本文按论文算例口径折算)——它不包含硬件销售,也不包含机房租赁,纯粹是运营成本的节约。

分配逻辑因此很清楚:价值从"单站点的能效与电价谈判"转移到"跨站点的时序编排"。一个只拥有一座机房的业主,无论 PUE 做得多低,都无法分享这部分价值;而一个同时运营多个地理站点的运营商,即使单站效率平庸,也能靠时序套利拿到成本优势。MC 事实上在给"跨区运营能力"定价。

十、竞争格局量化与市场规模三档情景

10.1 竞争格局:三个口径的集中度

口径一:加速卡供给,CR1 > 80%。按公开市场研究口径,数据中心 AI 加速卡市场高度集中,头部厂商份额长期在 80% 以上。这是公开口径,非本文实测。其含义是:MC 的全部优化都发生在式(6)给定的容量上限之内,而这个上限本身由单一供给源决定——约束的天花板握在别人手里。

口径二:算力增量的空间集中度,2.18 倍。这是有硬数据的量化。全国一体化算力网络 8 大枢纽节点的算力用电近 3 年平均增长率约 39.5%,而同期全国算力中心总用电增速为 18.1%(信通院 2025 年口径)。两者之比 39.5 / 18.1 ≈ 2.18,说明新增算力正在向枢纽节点集中。与国家枢纽节点新建数据中心绿电消费比例统一为 80% 这条要求叠加,意味着算力增量与绿电合规约束在空间上是重合的——最需要转移灵活性的地方,恰恰是合规约束最紧的地方。

口径三:算例内的容量集中度,主动下降。MC 在算例中把容量从 DC2(供电短缺且电价上涨)迁往 DC1 与 DC3。这是一个动态视角下的集中度变化:最优解不是把容量堆在最便宜的地方,而是在供电约束与价格之间做时序权衡。若只看成本最低化,容量会向低电价站点集中;加入供电上限后,集中度反而被主动压低。

10.2 市场规模:跨区算力负荷转移的三档情景

本节测算的是"可被空间转移的算力负荷"规模,即 MC 这类方法在中国语境下的理论作用空间。需要明确:可转移比例与价差均为本文假设,非实测值。

情景可转移比例假设2025 年(1700 亿千瓦时基数)2030 年(8000 亿千瓦时基数)按 0.1 元/千瓦时价差计的节约
低情景5%85 亿千瓦时400 亿千瓦时8.5 亿元 / 年(2030:40 亿元)
中情景15%255 亿千瓦时1200 亿千瓦时25.5 亿元 / 年(2030:120 亿元)
高情景30%510 亿千瓦时2400 亿千瓦时51.0 亿元 / 年(2030:240 亿元)

价格敏感性很直接:价差取 0.05 元/千瓦时时,三档节约减半(4.3 / 12.8 / 25.5 亿元);取 0.2 元/千瓦时时翻倍(17.0 / 51.0 / 102.0 亿元)。价差与可转移比例对节约规模的影响是一次方同权的——两者各减半,节约同样减半。但实践中价差的波动幅度通常远大于比例的不确定性,因此价差是更需要盯住的那个变量。

与现实的对照,才是这张表真正要说明的东西。2026 年中国算力大会期间披露的实测数据:国网廊坊供电公司通过跨区域算力负荷转移试点,完成廊坊至张家口的 1.5 兆瓦负荷转移;在度夏算电协同试验中,组织 29 家数据中心参与,压降负荷约 4 兆瓦。

本文把 4 兆瓦按全年持续折算,约为 0.35 亿千瓦时/年(4 MW × 8760 h = 3504 万千瓦时)。低情景的 85 亿千瓦时是它的约 243 倍,高情景的 510 亿千瓦时是约 1455 倍。理论空间与已实现规模之间,隔着两个到三个数量级。需要说明,试点量级是瞬时功率而非全年持续电量,此处折算仅为量级参照。

十一、上游风险与中国语境

黄昏时分的高压输电走廊与变电站,铁塔剪影延伸至远方
图 7 · 输电走廊与变电站:节点电价与供电上限是 MC 的两个外部输入信号(NewdPower 绘制)

11.1 五条上游风险

风险一:加速卡供给的物理天花板。CR1 > 80% 的供给集中度意味着,一旦供给端出现产能或贸易约束,式(6)的 An,t 与 Gn,t 直接收紧,MC 的优化空间随之缩小,且没有任何算法层面的补救手段。

风险二:模型越大,算力越不灵活。这是本文从式(3b)推出的最重要的一条推论。加载提前期 Lld = ⌈Trd/Δt⌉ 与就绪时间成正比。以 Δt = 15 分钟计:Trd = 10 分钟时 Lld = 1;Trd = 60 分钟时 Lld = 4。模型体量每上一个台阶,就绪时间变长,提前期变长,可响应窗口变窄。

但本文进一步认为,就绪时间的主体可能不是 I/O。按 BF16(2 字节/参数)粗算,Qwen2.5-32B 权重约 64 GB、Llama-3.3-70B 约 140 GB、DeepSeek-V3 按 671B 参数计约 1342 GB(此处的体量为按参数量 × 2 字节粗算,实际部署因量化与并行切分而不同)。即便按本文假设的 3 GB/s 单机存储读带宽计,64 GB 约需 21 秒、1342 GB 约需 7.5 分钟——都远小于论文算例中的 60 分钟。因此本文推断,60 分钟里的绝大部分是预热:CUDA kernel 编译、显存池分配、KV cache 预分配、CUDA graph 捕获与批处理校准。论文原文的表述是 "loading and warming up these replicas require substantial time",与该推断方向一致,但论文未对两者做拆分,此为本文推演。

这条推论的工程含义很实在:缩短就绪时间的抓手在预热流水线化与常驻热备池,而不在更快的存储。把存储带宽再翻一倍,可能只省下几十秒;而把预热过程做成可复用、可并行的流水线,动的是几十分钟的量级。

风险三:网络与 I/O 带宽。跨站点路由带宽约束与数据中心 I/O 约束在论文中引自文献 [6] 与 [7],正文中省略了具体形式,本文未做复现。这两条约束在大规模部署时会成为实际瓶颈:跨区转移的是请求流量,加载转移的是模型权重,两者争抢的可能是同一条骨干网。

风险四:电力接入的硬约束。式(7d)的 P̄n,t 是外部给定的供电上限,PUEn 是乘数。在中国语境下,数据中心并网容量本身就是稀缺资源;MC 只能在给定的功率天花板内做时序优化,无法凭空创造容量。

风险五:价格信号的可用性。论文用美国三个区域的真实节点电价作为空间信号。中国的省级现货市场在价格颗粒度、分区方式与跨省价格信号的可获取性上与之不同,且跨省算力转移还涉及省间市场壁垒。价格信号缺失或被行政区划截断时,MC 的目标函数(式 2)就只剩下第一项在起作用,优化退化为"尽量不丢请求",空间套利的部分全部失效。

11.2 中国语境:从 1.5 兆瓦到百兆瓦

把论文的算例尺度与中国现实并排放,差距一目了然。论文是 3 个数据中心、百兆瓦量级的 DeepSeek-V3 功率剖面;中国已公开的跨区算力负荷转移试点是 1.5 兆瓦与 4 兆瓦。这中间差的不是算法,而是三件基础设施。

第一件:可预期的跨省价格与供电约束信号。MC 之所以能在需求峰值(论文读数约 23:00)之前约 90 分钟(约 21:30)做出正确的容量再配置决策,前提是全时段的价格与供电上限是已知输入。中国的调度体系能否为数据中心提供这样一条提前发布、跨省可比的信号,决定了这类方法能不能落地。

第二件:跨省算力的统一调度权。论文假设一个运营商同时调度 DC1、DC2、DC3。现实中的"东数西算"跨越了不同省份、不同运营主体的园区。廊坊至张家口的 1.5 兆瓦试点之所以是新闻,恰恰因为跨行政区的调度权协调本身就是难点。

第三件:绿电核算主体的归属规则。这是一个本文提出的、目前政策尚未明确的问题。42 号令下,重点用能行业可再生能源电力消费最低比重目标按"用能主体"核算,国家枢纽节点新建数据中心的比例为 80%。如果一笔推理请求从东部转移到西部的数据中心执行,那么这度电的绿电消费算东部需求方的,还是西部承载方的?按附件 2 的口径,自发自用电量计入"该用能主体"、绿电直连电量计入"项目用能主体"——本文推断,这两个主体在跨省算力转移场景下并不重合,但目前无明文规则可依据。在没有明确规则之前,跨区算力转移的绿电账本是记不清的。

另一方面,中国的推进路径也有自己的特色。国家能源局提出的思路是"以电强算、以算促电",明确要"统筹通算、智算、超算等不同类型算力设施用电特性和调节潜力,优化算力负荷安排",并"以电力时空价格信号为指引引导其主动适应系统调节需求"。这句话的内核与 MC 完全一致——区别只在于,MC 给出了实现它所需的具体约束结构。

十二、边界与局限

论文层面的局限。其一,这是一篇 3 页的 letter,算例规模为 3 个数据中心、3 个模型,未做大规模系统验证或真实部署验证。其二,完整的参数设置在论文中未给出,指向外部代码仓库的参数配置文件,本文因此无法独立复核 PUE、模型服务吞吐与 GPU 规格等取值。其三,论文只处理推理负载,未涉及训练负载——训练任务的中断代价、检查点机制与可迁移性与推理完全不同,不能套用同一套结论。其四,排队模型用的是均值近似,式(8)在数学上退化为 M/D/1 特例,γ 为经验校准系数,对长尾分布的实际覆盖能力未经验证。其五,价格与场景取自美国三个区域,与中国市场结构差异较大。其六,论文只取 15 分钟单一分辨率,未讨论更短分辨率下加载提前期的粒度损失。

本文推演层面的局限。其一,三档情景中的可转移比例(5% / 15% / 30%)与跨区价差(0.1 元/千瓦时)均为本文假设,没有实测支撑,只应用于量级判断。其二,模型权重体量为按参数量 × 2 字节(BF16)粗算,实际部署因量化、张量并行与 MoE 稀疏激活而差异很大。其三,"60 分钟就绪时间中预热占主体"是本文基于数据量级的推断,论文未做拆分。其四,CR1 > 80% 为公开市场研究口径,非本文实测。其五,4 兆瓦试点按全年持续折算为 0.35 亿千瓦时,属量级参照而非实际年电量。

十三、结论与观察指标

这篇 3 页的 letter 做的是一件很小但很关键的事:它指出"把算力搬走"这句话在工程上不是一个瞬时动作,而是一个需要提前承诺的过程,然后把这个过程的约束结构完整地写了出来。

三条结论。第一,空间负载转移不是一个调度问题,而是一个承诺问题。谁想让算力可调度,谁就必须先把算力变成可承诺的——也就是提前把模型副本放到该在的地方。忽略这一点,服务率会从 100% 掉到 67.40%。

第二,29.0% 与 100% 是两件不同的事,不能混着说。29.0% 的成本下降来自价格响应(对照 B4,两者服务率同为 100%);而从 95.43% 到 100% 的那一截服务率提升来自提前期建模。前者是经济性优化,后者是可行性突破。评估任何数据中心需求响应方案时,都必须先固定服务率再比成本,否则会得出方向相反的结论——B5 的度电成本最低(16.77),服务率却只有 56.89%。

第三,数据中心的柔性不是免费的,它有固定的"最小出力"。MC 在需求下降时保留副本而非反复装卸,在功率曲线上留下持续基底负荷,这与机组组合为避免频繁启停而保留最小出力是同一个逻辑。对电力系统而言,这意味着数据中心作为需求响应资源,其可调节区间是"上限之下、基底之上"的那一段,而不是从零到额定。

对中国而言,最值得记住的一句话是:算电协同的瓶颈,不是"愿不愿意调",而是"能不能提前 60 分钟知道要调"。前者是意愿问题,后者是基础设施问题。廊坊到张家口那 1.5 兆瓦的试点之所以重要,不在于规模,而在于它验证了跨行政区的调度权是可以打通的——这一步走过之后,剩下的才是算法与信号的事。

观察指标当前基准读数含义
跨区算力负荷转移实测规模廊坊—张家口 1.5 MW;度夏试验压降 4 MW若持续停留在兆瓦级,说明调度权与信号仍是瓶颈
省级现货价格信号的颗粒度与跨省可比性各省现货市场建设进度不一决定 MC 目标函数第二项能否真正起作用
大模型副本就绪时间 Trd 的实测值论文算例取 60 分钟决定 Lld 与所需提前期;值越大,可响应窗口越窄
万卡级智算集群数量与枢纽用电增速42 个;枢纽节点近 3 年年均 39.5%增量集中度越高,跨区转移的价值越大
跨省算力转移的绿电核算归属规则政策未明确规则落地前,转移的绿电账本记不清,合规路径不通

最后回到方法本身。MC 的骨架是混合整数线性规划,求解难度随站点数、模型数与时段数快速增长,论文为此开发了 fix-and-re-optimize 算法来保证实时性并防止同时充放(该算法为论文自述,本文未独立验算其求解性能)——这又是一个从储能调度里借来的手法。电力系统用了四十年积累的机组组合工具箱,正在被数据中心一项一项地借走。这一次借走的是"承诺",下一次可能是"备用",再下一次也许是"容量市场"。对电力行业的人来说,这不失为一个提醒:那些被当作成熟甚至过时的工具,正在另一个行业里变成前沿。

资料来源:Bojun Du, Hongyang Jia, Tonghui Li, Qingchun Hou, Ze Wang, Ershun Du, Ning Zhang, "Spatial LLM Workload Shifting Needs Foresight: Model Commitment for AI Data Center Operation under Power Grid Constraints", arXiv:2609.09787v1 [eess.SY], 2026-09-09(本文解读基于该论文原文,公式编号与算例数值均引自原文)。中国侧数据来源:国家能源局 2025 年全国算力中心总用电量 1700 亿千瓦时口径;中国信息通信研究院 2025 年算力中心用电量约 1960 亿千瓦时、同比增 18.1% 及 2030 年三情景预测;全国一体化算力网络 8 大枢纽节点算力用电近 3 年年均增速 39.5%;2026 年中国算力大会期间披露的廊坊至张家口 1.5 兆瓦跨区域算力负荷转移试点与度夏算电协同压降负荷约 4 兆瓦;《可再生能源消费最低比重目标和可再生能源电力消纳责任权重制度实施办法》(2026 年第 42 号令)及国家枢纽节点新建数据中心绿电消费比例 80% 要求。可转移比例(5% / 15% / 30%)、跨区价差(0.1 元/千瓦时)、BF16 权重体量与就绪时间构成均为本文假设或推算,已在正文标注。

免责声明:本文为公开信息整理与分析,观点仅供参考,不构成投资建议。数据以官方原始发布为准。