← 返回首页

电力行业的智能体考卷:PowerBench 用 761 台设备与 1335 万条遥测,测出大模型的真实水位线

深度 · research · 2026-10-08 · NewdPower 研究 · 阅读约 50 分钟 · 万字深度+行业分析

现代电网调度控制中心,大屏幕显示电网运行数据
图 1 · 电网调度控制中心:当智能体开始参与这类工位的分析工作,行业首先需要一张可信的考卷(NewdPower 配图)

大模型能不能进电网控制室干活?这个问题在2026年已经有了两个方向的答案。产业侧是热情的:国家电网"光明电力大模型"作为千亿级多模态行业大模型已覆盖总部及27家省级电力公司、赋能六百余个业务场景,南方电网"大瓦特"体系建成近300个"AI+"应用场景;政策侧是明确的:2026年4月,国家发改委、国家能源局等四部门联合印发《关于促进人工智能与能源双向赋能的行动方案》,从国家层面确立"以电强算、以算优电"的双向赋能范式,部署29项重点任务。但工程侧的答案始终缺席——在一个用真实运行数据保密、任务链条横跨时序与文档的场景里,市面上没有一张能可靠测量"智能体真实水位"的考卷。

2026年9月28日提交到arXiv的论文《PowerBench: A Benchmark for Agentic Retrieval and Reasoning in Power Systems》(编号2609.34492)试图补上这张考卷。同济大学、上海人工智能实验室联合约翰霍普金斯大学、卡内基梅隆大学、新加坡国立大学以及国家电网大数据中心的研究团队,构造了一个包含761台设备、1335万条逐小时遥测记录、2.5万份运维文档的合成电力数据世界,并在其上出了300道题,让九个前沿大模型智能体在受限的工具调用与时间预算下作答。结果相当清醒:最好的模型联合准确率只有74.2%,而最能模拟真实运维工作流的跨设备比较任务上,绝大多数模型接近零分。

这篇论文值得电力与算力两个行业共同细读。它既是一份评测基准的技术设计(如何在没有真实数据的情况下造出一个自洽的考试环境),也是一份对当前大模型能力边界的冷静测量(找到证据不等于算对答案),还是一扇观察电力AI产业落地节奏的窗口——毕竟,电网侧自己也在等一个能回答"哪些环节可以放心交给智能体"的工具。本文基于论文原文独立解读,并结合公开产业数据,给出我们的拆解与推演。

一、论文信息卡

项目内容
标题PowerBench: A Benchmark for Agentic Retrieval and Reasoning in Power Systems
编号与方向arXiv:2609.34492,cs.AI,2026年9月28日提交(v1)
作者与机构同济大学(王西京、程大伟等)、约翰霍普金斯大学、上海人工智能实验室、卡内基梅隆大学、新加坡国立大学、国家电网大数据中心
开源框架、数据集与评测任务托管于 open-compass/PowerBench(OpenCompass 评测生态)
核心产出数据生成框架 + 合成数据集(761设备/1335万遥测/24939文档)+ 300道题的三族任务基准
关键结论九个前沿模型中最好者 Macro 联合准确率仅 74.2%;跨设备比较任务(CoRR)最好 48.7%,多数模型近零

论文的作者构成本身就值得注意:这是一个高校牵头、评测机构(上海人工智能实验室的OpenCompass是国内主流大模型评测体系)提供基础设施、电网大数据中心参与的双边组合。通讯作者团队来自同济大学,而国网大数据中心的参与意味着这份考卷的设计语言贴近电网真实的工单与数据形态——这一点在后文的任务设计里处处可见。

二、造一个自洽的数据世界:四阶段生成框架

评测电力智能体的第一个拦路虎是数据。真实的电网运行数据属于保密范畴,公开数据集又各有残缺:SGCC数据集只覆盖窃电检测的数值记录,PowerGridQA是纯文本的领域知识问答,Real-E聚焦功率预测,最新的多模态合成电网数据集只做了数据、没做任务。论文的判断很直接:现有公开资源无法刻画"链式依赖+异构证据"这两个工业场景的核心难点。

PowerBench的解法是"造世界"。整个数据生成框架分四个阶段,所有数据都从同一个结构化状态导出,共享一条依赖链。

第一阶段:设备与指标建模。研究团队先人工整理出100种设备类型的原型(附录可见换流变压器、中压开关柜、套管等部件级类型),然后由大模型推断每种设备在哪些维度上存在个体差异(型号、电压等级、冷却方式等),据此生成共761台设备实例。每台设备的元数据 Md 包含配置参数 ad、原子指标集 Kd 与派生指标集 Hd——全数据集合计1275个原子指标加203个派生指标,共1478个。设备实例与配置通过联网搜索审计,确保生成的设备"像真的"。

第二阶段:可执行规则构建。对每种设备类型构建判断规则集,每条规则指定它依赖的指标、适用条件与阈值/时序条件。落到具体设备 d 时,只保留与该设备配置相容、且输入指标可得的规则——全集2044条规则中,每台设备各自持有其可执行的子集 Rd。规则写成可执行函数,这是整个框架的"物理引擎"。

第三阶段:遥测与事件合成。先生成两年的名义背景遥测(2024年1月1日至2025年12月31日,逐小时),并强制约束:任何规则在背景序列上都不触发,否则重新采样。然后注入目标事件——修改背景序列使某条规则恰好触发——同时生成"未遂事件"(near-miss,即看似异常但规则不触发)。注入后再次用规则函数验证,保证每个事件可被程序化地证实或证伪。最终数据集含1335万条逐小时遥测记录,约2.08亿个指标值。

第四阶段:接地文档生成。在元数据、规则与遥测之上渲染三类运维文档:761份设备档案、9132份巡检报告、15046份故障报告,合计24939份。故障报告的事件窗口、规则、阈值与遥测观测全部从 Rd 与 Td 导出——文档里的每一句话都能回溯到数据世界里的物理事实,这就是论文所说的"接地"(grounded)。

PowerBench 数据生成框架:一条依赖链,四个阶段 ① 设备与指标建模 100 类设备原型 LLM 推断差异维度 生成 761 台实例 ② 可执行规则构建 2044 条判断规则 阈值 · 时长 · 趋势 按设备配置筛选 ③ 遥测与事件合成 1335 万条逐时遥测 故障与未遂注入 规则函数双向验证 ④ 接地文档生成 档案 761 + 巡检 9132 + 故障报告 15046 每句可回溯数据事实 元数据+规则+时序 → 文档 同一数据世界 规则既造数据 也验答案真值 依赖链:M → R → T → D 元数据 M 规则 R 遥测 T 文档 D 注:每台设备 d 导出 O=(M,R,T,D) 四类相互依赖的数据;规则同时承担数据生成与真值验证双重角色。 遥测数值不经过 LLM 生成,由脚本按元数据与规则合成,避免语言模型数值漂移污染数据世界。
图 2 · 四阶段生成框架与 M→R→T→D 依赖链:规则函数既用来造数据,也用来验证答案真值,这是整张考卷可程序化判分的基础(NewdPower 绘制,据 arXiv:2609.34492)

用公式表达,每台设备 d 导出四类相互关联的异构数据 Od = (Md, Rd, Td, Dd),且依赖结构为 Md→Rd、(Md,Rd)→Td、(Md,Rd,Td)→Dd。这个设计的精妙之处在于"规则的双重身份":它既是生成遥测与文档的物理引擎,又是判卷的真值标准——题目问"某设备在某窗口是否越限",答案可以由规则函数直接算出,不需要人工标注。这解决了合成数据评测最致命的"真值可信吗"问题。

还有一个容易被忽略的工程细节:遥测数值本身不经过大模型生成。论文明确数值遥测由脚本端到端合成,大模型只参与设备维度推断、规则构建与文档叙事槽位的填充(模板优先、事实约束)。数值链路与语言链路分离,避免了语言模型的数值漂移污染整个数据世界——这是"用LLM造考卷"时必须守住的一条工程纪律。

三、考试规则:三类任务与受限预算

有了数据世界,出题的方式决定了考卷的含金量。PowerBench的300道题分三个任务族,分别对应三种真实的电力运维工作流。

时序检索与推理(TRR)模拟"巡检之后追 telemetry"的日常:给智能体一段自然语言线索(某设备的巡检记录与观察现象),要求它定位目标设备、依据文档选择相关指标、然后在指定的时序窗口内分析遥测数据。考的是把自由文本的巡检发现翻译成数值分析的能力。

上下文检索与推理(CRR)模拟"事件复盘重算"的场景:给出故障报告的事件叙述,要求智能体找回匹配的设备级规则、从叙述中提取运行工况、选择适用的规则参数,再对照遥测数据重新评估规则是否触发。考的是把描述性叙事转化为规则求值的具体条件。

比较检索与推理(CoRR)最接近检修班组的多设备排查:给定若干台目标设备,要求智能体分别检索各自记录、独立分析、再在统一尺度上比较,找出偏离正常状态最远的设备。考的是跨设备证据的组织与聚合——这正是工业分析里最常见的"多实例综合判断"。

智能体解题回路:受限工具与预算内的证据链构建 自然语言题目 只给线索 · 证据分散四类数据 检索与工具调用循环 50 次工具调用 · 300 秒双重预算 证据与推理 预算耗尽后仅可用已有证据作答 五件工具(所有模型共享同一客户端) list corpus 列出语料文件 search corpus 检索路径与文本 read file 读文档与 JSON read timeseries 物化 CSV 窗口 python 数值计算 严格判分:联合准确率 JA 一道题所有答案字段全对才算对 辅以字段准确率 FA(部分得分) 输出须符合 JSON 模式(最多一次自动重试) 过程诊断:五类追踪指标 RER 证据源发现率 · AER 证据内容获取率 TR 工具成功率 · VS 模式合法率 TE 相对工具效率(同族内最少调用=100) 设计意图:预算约束模拟真实工位——工程师不会无限次翻档案,答案必须按时按 JSON 交回。
图 3 · 考试规则:五件共享工具、50 次调用与 300 秒预算、JA 严格判分加五类过程指标,把"答对"拆解为可归因的五个阶段(NewdPower 绘制,据 arXiv:2609.34492)

考试规则的两处设计值得推敲。其一,预算约束——每题50次工具调用、300秒,任一耗尽后工具禁用,模型只能凭已收集的证据作最后一次回答。这不是刁难:真实工位上工程师同样不会无限次翻档案,答案必须限时交回。其二,判分与诊断分离——联合准确率(JA,所有字段全对才算对)度量结果,而RER(需要的证据源找到没有)、AER(证据内容真的读进上下文没有)、TR(工具调用成功率)、VS(答案格式合法率)四个过程指标把失败拆到阶段(另有TE度量相对调用成本,只反映成本不反映质量)。绝大多数智能体基准只报告最终准确率,PowerBench保留完整执行轨迹的做法,让它能回答"模型挂在哪一步"——这也是论文标题里"retrieval and reasoning"并重的含义。

答案必须以规定JSON模式交回这个细节,同样是对工业现实的复刻。电网信息系统之间靠结构化接口交换数据,一个分析结论要进入工单、进入调度日志,就必须是机器可解析的字段,而不是一段漂亮的自然语言叙述。把输出格式合法性(VS)单独作为指标,等于承认"答得对但交不回"在真实工位上同样是失败。这个设计让PowerBench的成绩更接近工程可用性的下界估计,而非纸面能力的上界。

四、主结果:单设备合格,跨设备塌方

九个参评模型覆盖了2026年国内外的主力阵容:GPT-5.6-Sol、DeepSeek-V4-Pro、Qwen3.8-Max、Kimi-K3、GLM-5.3、MiniMax-M3、Llama-4-Maverick、Doubao-Seed-Evolving与Gemini-3.6-Flash。结果呈现出清晰的三个梯队。

PowerBench 总榜:Macro 联合准确率(%) 0 25 50 75 GPT-5.6-Sol 74.2 GLM-5.3 63.3 Doubao-Seed-Evolving 59.3 DeepSeek-V4-Pro 46.5 Gemini-3.6-Flash 46.4 Kimi-K3 45.5 MiniMax-M3 25.7 Qwen3.8-Max 18.3 Llama-4-Maverick 2.2 注:Macro-JA 为三族任务联合准确率的等权平均;95% 自助法置信区间见论文表4,DeepSeek-V4-Pro 与 Gemini-3.6-Flash 区间重叠。
图 4 · 九模型总榜:最好的 GPT-5.6-Sol 也只拿到 74.2%,且优势主要来自跨设备任务;尾部模型几乎交白卷(NewdPower 绘制,数据:arXiv:2609.34492 表4)

第一梯队只有GPT-5.6-Sol一个,74.2%;GLM-5.3(63.3%)与Doubao-Seed-Evolving(59.3%)构成第二梯队;46%上下扎堆着DeepSeek-V4-Pro、Gemini-3.6-Flash与Kimi-K3;MiniMax-M3、Qwen3.8-Max明显掉队,Llama-4-Maverick的2.2%几乎等于交白卷。论文特别指出,DeepSeek-V4-Pro与Gemini-3.6-Flash的置信区间重叠,总体差异不具统计显著性。

真正有信息量的是分任务表现。三个任务族呈现出一致的规律:单设备任务(TRR、CRR)上多数模型表现尚可——Doubao在TRR拿到86.7%,GLM-5.3在CRR更是拿下96.7%的全场最高分;但到了多设备比较任务(CoRR),最好的GPT-5.6-Sol也只有48.7%,其余模型大多接近零分。字段的层面同样如此:GPT在CoRR上字段准确率74.0%但联合准确率只有48.7%,Kimi-K3字段准确率30.4%对联合准确率2.7%——单台设备能答对一部分,把多台设备的结果组织成一个完整正确的答案,是另一回事。

分任务联合准确率:单设备尚可,跨设备塌方(%) 0 25 50 75 100 85.0 88.9 48.7 GPT-5.6-Sol 80.0 96.7 13.3 GLM-5.3 86.7 91.1 0.0 Doubao-Seed 48.3 85.6 2.7 Kimi-K3 TRR 时序检索推理 CRR 上下文检索推理 CoRR 跨设备比较推理 数据:论文表4,取四个代表性模型
图 5 · 分任务对比:GLM-5.3 在上下文规则重算上拿到全场最高的 96.7%,但跨设备比较只剩 13.3%——强单点分析不能自动迁移为多实例综合(NewdPower 绘制,数据:arXiv:2609.34492)

这个结果对产业落地的含义相当直接。如果智能体只做单设备的辅助查询(这台设备巡检后指标走势如何、这条规则在当时工况下是否触发),当前头部模型已经接近可用;但电网运行与检修中大量高价值判断本质上是多源多设备综合(哪台设备最需要停电处理、检修资源怎么排序),恰恰是这条能力短板卡住了"从工具到决策"的最后一公里。论文自己的措辞是:强单设备分析并不能轻易迁移到需要跨设备组合证据的任务上——这构成了PowerBench存在的理由。

五、失败归因与规模效应:找到证据不等于算对答案

总榜只说明"差多少",过程指标才说明"差在哪"。论文的追踪分析给出了一组非常有诊断价值的对照。

最刺眼的证据来自Kimi-K3:在CoRR任务上,它的证据源发现率(RER)68.86%全场第一,证据内容获取率(AER)67.86%第二,格式合法率98.67%,工具成功率97.27%——四项过程指标均居前列,联合准确率却只有2.7%。DeepSeek-V4-Pro同样如此:全场最高的工具可靠性98.49%,CoRR准确率0.7%。对这两类模型,瓶颈不在检索也不在工具,而在证据已经进入上下文之后的逐设备计算、跨设备比较与最终聚合。换言之,它们"看得见"证据,但"算不拢"。

另一些模型的失败模式完全不同。Qwen3.8-Max在CRR上证据源发现率90.56%,证据获取率却只有40.74%,工具错误率高达81%——找得到文件,读不进内容,大量工具调用失败把预算烧光。MiniMax-M3呈现类似的脆弱性。Llama-4-Maverick则是另一个极端:几乎不发起工具调用,证据获取率接近零,属于"不会考试"的类型。论文的总结是:不同模型挂在不同的环节上——检索、工具使用、跨设备推理各有各的坎,一张只报告总分的榜单会把这些问题全部掩盖。

过程指标的三种失败画像(据论文表5与正文):①检索瓶颈型——证据源发现率与获取率低(Llama-4-Maverick,几乎不调用工具);②工具脆弱型——发现得了证据源但工具错误率高、内容读不进(Qwen3.8-Max:RER 90.56%对AER 40.74%,工具错误率81%;MiniMax-M3类似);③推理瓶颈型——证据齐、工具稳,倒在跨设备计算与聚合(Kimi-K3:四项过程指标均居前列、CoRR联合准确率2.7%;DeepSeek-V4-Pro:工具可靠性98.49%、准确率0.7%)。GPT-5.6-Sol的优势正是三类瓶颈都相对最浅。

规模效应的两组实验进一步刻画了"跨设备塌方"的形状。其一是题目内设备数:在CoRR的3-5台设备分组中(每组50题),GPT-5.6-Sol的联合准确率从3台的60.0%降到5台的40.0%,字段准确率从83.3%降到66.6%,平均工具调用从26.7次升至35.6次,时延从188秒升至286秒;DeepSeek-V4-Pro的字段准确率从20.9%一路跌到9.1%。设备越多,逐台分析的重复劳动与最终聚合的复杂度同步上升,预算却不变。论文谨慎地注明:分组题量不同,趋势是描述性的,不能孤立归因于设备数本身。

其二是可见语料规模:论文在同一批60道CoRR题的既有运行上对比了200、400、600、761台设备的可见语料,GPT-5.6-Sol的联合准确率从31.7%升至50.0%,而其证据源发现率在57.2%-57.9%区间内平稳——语料变大,检索难度没有明显恶化,Gemini-3.6-Flash则始终为零。论文同时声明该对比仅复用已有运行、N=761点复用主批次且响应的模型标识符或有差异,不将这一上升单独归因于语料规模(200至600区间内的变化仅5个百分点,置信区间含零)。论文附录H的这组结果提醒我们:多设备任务的难点主要在比较与聚合的组织方式,而不是"沙里淘金"式的检索。这个发现对产业侧是个好消息——真实电网的设备规模远大于761台,若瓶颈在检索,智能体方案将随规模失效;瓶颈在推理组织,则可以通过任务分解与工作流设计来工程化缓解。

把这份考卷与本站此前解读过的AgentiGrid实验(2026年9月17日《把潮流计算交给智能体》)并排看,会发现两条互补的结论:AgentiGrid测的是电网规划类任务中多轮工具迭代与自我纠错的上限,PowerBench测的是运行分析类任务中受限预算下的证据链组织下限。前者证明智能体在"可以反复试错"的离线场景里有惊喜,后者证明在"必须一次做对"的在线场景里还有硬缺口。两张考卷合起来,才拼出大模型进电网的完整能力地形图——离线规划先行、在线分析随后,恐怕是未来两三年电力AI落地的自然顺序。

六、产业坐标:双向赋能行动方案下的电力AI落地节奏

把论文放回产业坐标,2026年正是电力AI从试点走向体系化的一年。政策层面,国务院部署"人工智能+"行动之后,2026年4月四部门联合印发《关于促进人工智能与能源双向赋能的行动方案》,从国家层面确立"以电强算、以算优电"的双向赋能范式,围绕算力供电保障、绿电直连、智能调度等部署29项重点任务;2026年《政府工作报告》将"算电协同"纳入新基建工程,"十五五"规划纲要提出推动绿色电力与算力协同布局。供给层面,全国全口径发电装机容量2026年6月底达40.4亿千瓦,非化石能源占比62.4%——高比例新能源系统对智能分析的需求不是锦上添花,是消纳与安全的刚需。

企业侧的两个标志性工程刻画了行业模型的渗透方式。国家电网"光明电力大模型"是千亿级多模态行业模型,已覆盖总部及27家省级电力公司,赋能规划建设、电网运行、设备管理等600余个业务场景;南方电网"大瓦特"体系建成近300个"AI+"应用场景,其中"大瓦特·驭电"将电网仿真分析速度提升1000倍、误差控制在1.5%以内。设备与集成侧,国电南瑞的电力AI大模型打通特高压换流站、新能源电站与算力调度平台的数据壁垒,能根据AI企业的训练排期预判算力负荷变化、提前调度西部绿电——截至2026年3月,南瑞特高压控制保护设备占全国过半市场,在手订单超620亿元,其中算电协同相关订单占比达四成。

但PowerBench的结果提示了这轮落地浪潮中被乐观叙事遮蔽的一环:场景数量(600个、300个)衡量的是部署广度,不等于决策质量。当智能体从"辅助问答"走向"多设备综合判断",当前模型的能力水位距离放行还有明显差距——而后者才是电网运行与检修中价值密度最高的环节。

电网之外的渗透同样在加速。发电与售电侧,朗新集团在2026年发布了面向能源场景的"九功"行业大模型与配套的交易智能体,将大模型引入电力交易辅助决策(据行业公开信息);远光软件覆盖电力交易全流程系统,据公开资料其控股股东为国网旗下数字科技公司,深度嵌入集团财务与购售电体系。这些动作与电网侧的行业模型形成呼应,说明电力AI的需求已经从"电网自己的事"扩展为全产业链的数字化基建。场景越多、系统越多,"用一把统一的尺子量能力"的需求就越刚性——这正是评测基准在产业成熟曲线上必然出现的位置。一张可信的考卷,恰好把"哪些环节可以交给智能体、哪些环节必须留给人"这个问题从感觉变成数据。这也解释了为什么国家电网大数据中心会出现在作者名单里:电网自己最需要这张考卷。

七、产业链与利润池:电力AI的钱在哪个环节

把电力AI摊成一条产业链,大致分五层:底层的AI算力(智算中心与GPU供给)、其上的基础大模型、面向行业的模型与评测基础设施(行业语料、微调、基准)、系统集成与电力数字化服务商,以及最下游的电网与发电企业用户。每一层的利润逻辑差别很大。

电力 AI 产业链分层:价值分布与利润池特征 L1 算力层 · 智算中心 / GPU 供给 重资本 · 供给受出口管制约束 · 利润随供需周期波动 L2 基础大模型 · 通用能力供给 API 价格战压缩毛利 · 能力快速迭代 · 规模效应主导 L3 行业模型与评测基础设施 · 语料 / 微调 / 基准(PowerBench 所在层) 数据壁垒与工程 know-how 定价 · 竞争尚少 · 电网参与度高 L4 电力数字化集成 · 调度自动化 / 信息化 / 功率预测 壁垒最高 · 国网系主导 · 市场规模最大(见下节 CR 量化) L5 用户侧 · 电网 / 发电集团 / 售电与园区 需求真实但决策链长 · 招标制 · 定价权强(买方市场) 利润池 向上集中 于壁垒 注:分层为本文归纳口径;PowerBench 属 L3 层评测基础设施,其国网大数据中心背景印证了 L5 用户向 L3 的直接渗透。
图 6 · 电力AI产业链五层结构:利润池向高壁垒环节集中——L4 集成端规模最大但由国网系锁定,L3 评测与行业数据基础设施是竞争最少的洼地(NewdPower 绘制)

按中研普华产业研究院数据,2026年国内智能电网行业市场规模约1.85万亿元,同比增长12.3%;其中电网数字化配套产业(电力物联网、电网大数据、智能调度、数字孪生)市场规模突破3200亿元,增速18.2%,显著高于传统电力基建。投资结构上,有省级电网数字化负责人给出的量化信号是国家电网全年智能化改造投资占比提升至65%、南方电网数字化智能化投资占比突破70%——钱正在从"建骨架"转向"强神经"。

利润池的分布特征比总量更值得注意。第一,集成与软件环节毛利率显著高于设备制造:以南瑞为例,2025年研发投入占营收比重8.2%,其2026年半年报中能源低碳板块收入96.14亿元、同比增长46.98%,数能融合板块收入36.96亿元——软件与算法密集板块的增速远高于传统二次设备。第二,L3层(行业模型、语料与评测)目前几乎没有独立的市场化玩家,光明与大瓦特都是电网自研自用,PowerBench这类学术开源项目承担了准公共品的角色;这一层的定价权尚未形成,先发者有机会把基准变成事实标准。第三,上游算力与基础模型的价格竞争反而利好L3-L4——模型调用成本持续下降,行业 know-how 的相对价值上升。

八、竞争格局量化:营收口径的CR3与赛道分层

电力数字化的竞争格局需要分赛道看,用一个总量CR会掩盖结构。下表厂商营收为市场公开整理口径的近似值(含非数字化业务,非公司分部披露数据,2026年中口径),主要玩家与集中度如下。

赛道规模量级主要厂商(年营收近似)格局特征
电网调度与自动化大于500亿元/年国电南瑞(约500亿)、许继电气(约170亿)、国网信通(约85亿)、国电南自(约80亿)、东方电子(约70亿)、四方股份(约60亿)壁垒最高、国网系主导、市场化程度低
电力企业信息化200-300亿元/年朗新集团(约50亿)、远光软件(约26亿)、海颐软件、恒华科技细分领域冠军制(财务/营销各守一域)
新能源功率预测约17亿元(2024)分散,头部市占率约两成(行业整理口径)市场化程度最高、集中度低

以六家电网自动化厂商的营收近似值合计约965亿元计,营收口径CR3(南瑞+许继+国网信通,755亿元)约78.2%、CR4(加国电南自)约86.5%——必须强调这是营收结构口径而非细分市场份额:营收中含大量非调度自动化业务,实际调度自动化市场的集中度更高(南瑞的特高压控制保护设备占全国过半)。相比之下,功率预测赛道头部仅约两成份额,是电力数字化中竞争最充分、也最能检验技术alpha的细分。

这个格局对"AI进入电网"的路径有直接影响。国网系厂商(南瑞、许继、国网信通、国电南自)占据着调度自动化这一数据密度最高、预算最厚的赛道,外部AI公司的切入面主要在发电侧、新能源侧与企业信息化侧——这也解释了为什么首批行业大模型(光明、大瓦特)全部由电网自研:数据主权与安全责任决定了核心场景的入场券只在体系内流转,PowerBench用合成数据绕开真实数据保密约束的思路,正是对这条壁垒的直接回应。

九、市场规模测算:电力AI应用的三档情景

电力AI市场的规模测算需要先定义口径。本文定义"电力AI应用市场"为电网与发电企业在行业大模型、智能体应用、评测与数据服务上的直接支出(不含传统自动化改造与通用IT),基数锚定电网数字化配套产业2026年约3200亿元(中研普华口径)中的AI相关部分,按两大电网在行业模型上的投入体量(光明千亿参数研发加27省部署、大瓦特300场景)与第三方电力AI软件市场推算,2026年约150亿至200亿元,本文取160亿元为基数(推演口径)。

情景数字化配套CAGR2028年配套市场AI支出占比2028年电力AI应用市场
保守15%约4230亿元3%约130亿元
基准18%约4460亿元6%约270亿元
乐观22%约4760亿元10%约480亿元
2028年电力AI应用市场规模:三档情景(亿元) 0 120 240 360 480 ≈130 保守 4230亿 × 3% ≈270 基准 4460亿 × 6% ≈480 乐观 4760亿 × 10% 基数与占比均为本文推演口径:2026年AI相关支出约160亿元(占数字化配套约5%);三档对应不同的落地节奏。
图 7 · 三档情景:分歧不在数字化大盘(15%-22%的CAGR差异温和),而在AI支出占比能否从约5%翻倍——这取决于多设备综合判断类任务的可靠性验证进度(NewdPower 绘制)

情景的分歧点不在数字化大盘——三档CAGR(15%/18%/22%)对2028年配套市场的影响只有4230亿到4760亿元——而在AI支出占比。占比从5%走到10%意味着智能体从问答助手升级为进入调度、检修决策流的工作成员,而PowerBench的评测结果恰恰指出:这个升级的关键瓶颈(跨设备推理)尚未解决。换言之,保守与乐观情景的分野,就卡在"74.2%与48.7%这两个数字所代表的能力缺口"能否在两三年内补上。若以基准情景约270亿元计,其中相当比例将继续流向体系内厂商(自研模式),第三方市场的实际可及规模要再打折扣——这是评估"电力AI创业"时最容易高估的地方。

十、上游风险:算力、数据与责任的三重约束

产业链上游与配套环境的风险集中在三处。

算力供给与出口管制。电力AI的训练与推理依赖高端GPU,供给受地缘政治约束。政策对冲的方向是国产化:电力专用芯片国产化率已突破93%,但通用大模型训练算力的国产替代仍处于爬坡期。若算力成本因管制上行,L3-L4层的研发节奏将首先承压。

数据保密与合规。这正是PowerBench以合成数据立身的动机:真实运行数据保密、监管限制严格,公开数据集残缺。关基条例与数据安全法规决定了核心场景的数据不出体系,行业模型只能"数据不动、算力动"。对第三方而言,可及的数据资产极其有限,评测基准与合成数据工程能力会成为稀缺的替代性资产。

可靠性验证与责任界定。论文在伦理声明中的表述值得全文抄录式地重视:基准结果不应被解读为任何电网的部署精度,下游用户在真实运行环境中应用基准或其发现时应保持审慎。电力是可靠性优先的行业,智能体建议错误的代价以停电与设备损坏计——在责任框架(谁为智能体的错误判断负责)与验证框架(用什么标准证明智能体达到放行水位)补齐之前,AI在电网中的角色将被锁定在辅助位。PowerBench是验证框架的一块拼图,但远不是全部:它测的是检索与推理,测不了实时性、对抗鲁棒性与极端工况。

第四重约束是人才与生态。既懂电力系统又懂大模型工程的复合团队极度稀缺,而评测与合成数据工程恰恰是最吃这种复合能力的环节——PowerBench的作者名单(高校情报学团队+评测机构+电网大数据中心)本身就是这种稀缺性的注脚。开源生态方面,基准与数据集的许可证条款、模型迭代带来的复评成本、榜单被"应试"污染的风险(针对基准的过拟合),都是这个新兴环节需要提前建立的治理机制。

十一、边界与局限

本文的解读与推演存在以下边界,需要向读者明示。

第一,合成数据与真实数据的差距是PowerBench自身的第一局限。论文如实承认:数据世界由模板与语言模型协作生成,设备类型来自原型推断,遥测由规则驱动合成。它没有真实电网的噪声结构、异常模式与坏数据——在真实工位上,数据质量问题本身就是运维工作的主要成分之一,而这是合成基准天然缺失的维度。论文的 Ethics 声明也明确其结果不应外推为部署精度。

第二,评测结果的时效性。九个模型的版本迭代以月计,榜单排名的保质期有限;更有价值的是方法论(依赖链生成、过程归因、预算约束)而非具体分数。本文引用的所有模型表现数据均指论文评测时的版本快照。

第三,产业数据的口径。智能电网1.85万亿与数字化配套3200亿为中研普华口径;厂商营收为公开整理的近似值,含非数字化业务;电力AI应用市场基数160亿元为本文推演,非任何机构发布口径;三档情景是本文的假设演绎,用于界定分歧而非预测点位。

第四,本文对论文的解读聚焦检索推理基准与产业映射,未覆盖论文附录中的全部实验(如数据生成提示词细节、联网搜索审计的具体算例与全部消融设置),对附录E设备数分组结论的转述也以论文"描述性趋势、非因果结论"的限定为前提,感兴趣的读者应以论文原文与开源仓库为准。

十二、结论与观察指标

PowerBench的价值不在74.2%这个分数,而在它把"大模型能不能进电网控制室"这个模糊问题,拆成了三个可测、可归因、可跟踪的子问题:证据找不找得到、工具用不用得稳、多台设备的结论拢不拢得齐。当前的答案是——前两问头部模型已接近合格,第三问多数模型接近零分。对产业而言,这意味着电力AI的下一阶段竞争不在通用能力,而在跨设备推理的工作流设计;对评测行业而言,依赖链生成加规则验证真值的范式,为所有"数据保密但急需评测"的工业场景提供了可复制的模板。

后续建议跟踪五个观察指标:其一,open-compass/PowerBench仓库的榜单更新与新模型在CoRR上的水位变化(跨设备推理是否出现代际改善);其二,光明与大瓦特的场景数从"部署量"向"决策类场景占比"的口径演进;其三,四部门行动方案后续落地细则中关于智能体验证与责任界定的条款;其四,国网系厂商在AI相关订单上的披露口径(南瑞算电协同订单占比四成是否延续);其五,电力AI第三方市场中围绕评测、语料与合成数据的新增玩家。当CoRR榜单上出现稳定超过70%的模型时,电力智能体从辅助位走向决策位的故事才算真正开始。

方法论层面的沉淀或许比榜单本身更持久:用可执行规则造数据、用同一套规则验真值、把预算约束写进考题、把失败拆到阶段——这套"依赖链生成"范式对任何数据保密但急需评测的工业场景(轨交、石化、核电、航空航天)都成立。中国的电力行业恰好同时具备三个条件:数据保密程度高、AI部署意愿强、开源评测基础设施趋于成熟。PowerBench之后,可以预期更多垂直行业出现同款考卷;谁能把"造考卷"做成标准化的生意,谁就在L3层拿到了定义能力的权力。

观点仅供参考,不构成投资建议。