把潮流计算交给智能体:AgentiGrid 的 20 次迭代实验,与四个大模型在电网规划里的能力边界

深度 · research · 2026-09-17 · NewdPower 研究 · 阅读约 26 分钟 · 万字深度+行业分析

一、论文信息卡与导读

论文信息卡:Integrating Agentic Artificial Intelligence with High-Performance Computing for Grid Planning(将智能体人工智能与高性能计算集成用于电网规划)。作者 Samim Konjicija(萨拉热窝大学电气工程学院)、Slaven Peleš(橡树岭国家实验室计算科学与工程部)。arXiv 编号 2609.04544,2026年9月3日提交,属 eess.SY 系统与控制分类。论文作者由美国能源部合同资助,成果按美国能源部公共访问计划公开。核心系统名为 AgentiGrid,论文摘要声明其可在不到 20 次迭代内、以接近完美的可靠性自主收敛输电约束交流最优潮流。

电网规划工程师的日常里有一类任务,翻译成数学很别扭,用语言却一秒钟说清:找出网络在哪一个负荷水平上失去可行性、识别受冲击时最脆弱的输电断面、在成本与电压质量之间找一个平衡的出力安排。这些问题无法直接写成标准优化目标函数,人类专家的解法是迭代探索——跑一次仿真、看结果、形成假设、改参数、再跑。高性能并行计算把单次仿真加速到秒级之后,瓶颈就只剩下人:提出假设、决定下一步的那个人。

这篇论文的命题就是把那个人换掉。AgentiGrid 让大语言模型扮演规划工程师的决策循环:模型提出参数修改方案,系统验证并应用到算例副本,调用橡树岭国家实验室的 ExaGO 高性能电力计算库执行仿真,解析输出、比对约束、更新搜索日志,再把摘要喂回模型进入下一轮。整个循环不需要人值守,运行中的人还可以随时插话改变搜索方向。论文的一句话主张:对于难以表达为形式化优化问题的电力系统分析任务,大模型作为优化器(LLM-as-optimizer)的范式是切实可行的。

但这篇论文最有价值的部分,恰恰是它对四个大模型后端的诚实记录。同一道"降低发电成本"的题目,Claude Sonnet 4.6 和 GPT-5.4 识别出基准工况已是最优解并宣告无改进,智谱 GLM-5.1 和 DeepSeek-V4-Pro 则无视"调整发电机出力"的指令约束,改做机组组合并把成本压低 36.9%——两种行为,一个是严格服从,一个是越界求解,都算对吗?答案取决于你把智能体当工具还是当工程师。本文按论文原文的推进顺序拆解这套系统与这批实验,并延伸至 AI 进入电力软件产业链的商业边界。

二、问题背景:仿真提速之后,瓶颈是人

论文的引言部分梳理了电力系统智能体研究的现状判断,有两条值得展开。第一条:现有的基于大模型的电力系统智能体绝大多数遵循顺序式的单仿真范式——每一步调用一次仿真,串行推进。这种设计的代价是高昂的 token 与时间成本:解开一个故障场景要走完一整条串行链,而故障扫描类任务天然可并行。第二条:已有的至少五个面向电力系统的智能体方案,功能上限差异很大——有的只做顾问,分析电网模型并给人提建议;有的能在后台跑仿真,识别哪些 N-1 故障或负荷增量有害;更进一步的系统能消解有害故障并带持续改进循环。

AgentiGrid 的差异化选择是把并行性放进工作流:ExaGO 本身是为集群与云环境并行执行设计的高性能电力优化库,论文把它包进一个由大模型驱动的搜索循环里,让多个场景或故障的仿真并行执行、统一后处理。这个组合的意图很明确——智能体负责探索策略(发散),HPC 负责物理计算(收敛),两者用清晰的协议隔离,谁也不绑架谁。

背景的另一层来自工程现实。输电网规划研究里,多场景分析是常态:一个规划方案要过数千次 N-1 校核、成组的负荷水平扫描、新能源出力的随机场景集。仿真工具链已经成熟——MATPOWER 格式几乎是无声的行业标准,商业工具与开源求解器并存——但从"算得动"到"知道该算什么"之间的那段认知工作,仍然由规划工程师完成。论文的立论正建立在这个缝隙上:自然语言到仿真任务的翻译能力,恰好是大模型的长项。

值得注意的还有它的出身。橡树岭国家实验室是美国能源部体系内做高性能计算与电力系统优化的主力机构之一,ExaGO 即其开发的电网优化库。一个国家实验室把 LLM 智能体接到自家 HPC 工具链上做系统实验,这个动作本身比单篇论文的结论更能说明方向:AI 进电网规划的主通道,正在从论文概念走向工程平台。

三、总体架构:三层分离与一次完整迭代

AgentiGrid 的架构分三层,层与层之间通过明确定义的协议通信,互不依赖实现细节。

第一层,智能体循环控制器。管理迭代循环,从搜索目标、日志历史、最新结果与活动中的转向指令组装提示词,把大模型响应解析为结构化动作,把结果记入搜索日志。它是三层的"大脑"。

第二层,分析编排器。接收模型生成的命令,对照算例数据做确定性验证,在带时间戳的独立目录里创建算例副本,把验证通过的命令应用到副本上,然后以子进程方式调用 ExaGO 可执行文件。仿真完成后,编排器提取结构化输出,对照修改后算例文件中的实际限值检查约束越限,更新搜索日志,给控制器回传一份紧凑摘要。

第三层,ExaGO 应用。物理仿真的执行引擎,提供六类分析能力:PFLOW(交流潮流)、OPFLOW(交流最优潮流)、DCOPFLOW(直流最优潮流)、TCOPFLOW(多时段最优潮流)、SCOPFLOW(安全约束最优潮流)、SOPFLOW(随机最优潮流,可含安全约束)。

AgentiGrid 三层架构:智能体循环、分析编排与 HPC 仿真 层间以明确定义的协议通信,互不依赖实现细节 第一层 智能体循环控制器 组装提示词:搜索目标 + 日志历史 + 最新结果 + 操作员转向指令 解析大模型响应为结构化动作,记录搜索日志(大脑) 第二层 分析编排器 确定性验证命令 → 时间戳目录建算例副本 → 子进程调用求解器 解析输出、对照限值查越限、更新日志、回传紧凑摘要(双手) 第三层 ExaGO 应用(橡树岭国家实验室 HPC 库) PFLOW 交流潮流 / OPFLOW 交流最优 / DCOPFLOW 直流最优 TCOPFLOW 多时段最优 / SCOPFLOW 安全约束 / SOPFLOW 随机最优(肌肉) 摘要回传 结果回传 架构依据:arXiv 2609.04544 第 II 节,NewdPower 重新组织绘制
图 1 · 三层架构:大脑、双手与肌肉的分工,协议隔离是可替换性的前提(NewdPower 绘制)

一次完整迭代的流程值得逐步走一遍。控制器接收 MATPOWER 格式的电网算例与一句自然语言请求;组装提示词交给大模型;模型返回一条 JSON 格式的命令;编排器对照算例数据验证这条命令——如果命令引用了不存在的元件或超范围的参数,验证直接拒绝并把错误回传给模型;验证通过则在独立目录建副本、应用修改、调用对应的 ExaGO 应用;仿真结束,编排器抽取结构化数据、按修改后算例里的真实限值核对约束越限、更新搜索日志、给控制器发一份紧凑摘要;控制器把摘要并入下一轮提示词。循环持续到模型宣告完成、发生关键错误或达到最大迭代数为止。

这个流程里有两个设计细节体现了工程判断。其一,每次修改都作用在算例副本上而不是原文件——搜索过程中的任何一步都可以回滚,原始数据不被污染,这与调度自动化系统里"先校验后执行"的安全范式同构。其二,越限检查以修改后算例文件中编码的实际限值为准,而不是以模型宣称的为准——物理事实只有一条来源,就是求解器的输出。这两条是智能体系统能被电力行业接受的前提条件。

单次搜索迭代:从自然语言到物理仿真的闭环 循环终止条件:模型宣告完成 / 关键错误 / 达到最大迭代数 自然语言目标 MATPOWER 算例 + 请求 大模型生成命令 JSON 结构化动作 确定性验证 对照算例数据 非法即拒绝并回传 副本上执行仿真 ExaGO 子进程并行 越限核对 以算例限值为准 更新搜索日志 紧凑摘要回传 并入下一轮提示词 循环直至终止 下一轮迭代 流程依据:arXiv 2609.04544 第 II 节迭代描述,NewdPower 重新组织绘制
图 2 · 单次迭代闭环:验证与越限核对都以算例数据为唯一事实源(NewdPower 绘制)

四、命令系统与提示架构:约束智能体的两个抓手

让大模型安全地操作电网算例,靠的不是提示词里的"请小心",而是两个结构性约束。

第一个抓手是感知应用的命令系统。每类 ExaGO 应用有自己的命令词表,覆盖变压器分接头变比、母线并联电纳、相移角等参数维度。命令在执行前经过确定性验证——所谓确定性,就是验证规则是代码而非模型,引用不存在的元件、超出物理范围的参数都会被机械地拒绝,并把运行时反馈回传给模型。这套设计等于给智能体划了一块沙箱:模型可以自由决定"改什么、改多少",但"能不能改"由系统裁决。论文专门强调命令词表按应用划分,这意味着 PFLOW 任务里的模型拿不到 SCOPFLOW 专属的操作——权限随任务收窄。

第二个抓手是分层组装的提示架构。每一轮提示词编码四类信息:搜索历史(之前试过什么、结果如何)、网络元数据(算例的规模与结构)、目标上下文(这次搜索要干什么)、操作员指令(转向要求,若有),再加按应用划分的指导段落。搜索历史的存在让模型不会重复自己一分钟前失败过的尝试;应用指导段落则相当于给模型配了一本操作手册的目录。大模型后端全部通过统一抽象接口接入——complete、name、supports_json_mode 三个方法,具体实现覆盖 OpenAI、Anthropic、Ollama 与 Ollama Cloud,温度压在 0.2 到 0.4 的低区间以换取结构化输出的一致性。

交互式转向是这套架构里最有人机协同味道的功能:用户可以在搜索运行中注入指令而不必停止它。机制用一个线程安全队列承载转向命令,支持 augment 与 replace 两种模式——前者把新指令叠加到当前目标旁边,后者清空全部既有指令、由新指令独占。活动指令作为提示词里一个独立的"操作员指令"段落注入。这个设计翻译成调度室的语言就是:智能体在前台跑分析,值班员可以在旁边随时喊"顺便看下另一条线路"或者"别管成本了,只看电压"。对比眼下大模型应用的普遍形态——一轮对话定生死——运行中转向是智能体走向工程可信的必要一步。

论文还提供了一个容易被低估的小设计:目标类型感知的搜索后分析。搜索循环结束后,由一次额外的大模型调用对搜索目标分类,四种类型各有"最佳迭代"的判据——成本最小化取可行成本最低的迭代;可行性边界取最贴近不可行边界的可行构型;约束满足取最满足指定约束的迭代;参数探索取信息量最大的可行构型。分类失败时回退到成本最小化。这个设计解决的是一个真实且阴险的坑:在可行性边界搜索里,负荷越大发电成本越高,如果机械地按"成本最低"挑最佳迭代,系统会把基准工况当成最优解报告出来——方向完全反了。目标分类这层"元认知",是防止报告误导工程师的最后一道闸。

五、实验设计:一个算例、三个目标、四个后端、十二次搜索

实验用的算例是 ACTIVSg200——一个合成的 200 节点网络,代表伊利诺伊州区域输电系统。网络有 246 条支路(其中 197 台变压器)、200 个负荷、49 台发电机(40 台在运行状态),标称电压从 13.8 千伏到 230 千伏,平均每节点仅 1.23 条边的低节点度加上频繁的输配电电压转换,使其成为检验智能体推理能力的非平凡测试平台。实验硬件是一台 14 核 Intel Core i7-13650HX 工作站、32GB 内存——没有用集群,这个细节说明实验定位在验证范式而非追求规模。

三条目标字符串分别驱动三类应用。PFLOW 目标:通过调整发电机出力降低总发电成本,同时保持可行性——注意基准工况 27564 美元已是经济调度解,这是一道陷阱题,考的是模型能不能识别"已是最优、无可改进"。SCOPFLOW 目标:系统测试 N-1 单线停运,按成本增加、电压越限或不可行性排序识别最关键线路。SOPFLOW 目标:用风电场景文件评估电网能否同时应对所有风电出力场景,并识别受风电波动影响最大的母线。

四个大模型后端收到逐字相同的目标字符串,外加一条持续探索指令(求解器收敛但结果无信息量时不要停、继续探索改过的问题)。固定提示词是为了让行为差异归因于模型本身而不是提示词工程。四个后端是:Anthropic Claude Sonnet 4.6、OpenAI GPT-5.4、智谱 GLM-5.1、DeepSeek-V4-Pro(后两者经 Ollama Cloud 接入)。所有运行的最大迭代预算 20 次,温度 0.3。SCOPFLOW 与 SOPFLOW 使用 ExaGO 的并行 EMPAR 后端,PFLOW 使用牛顿-拉夫逊法。合计 12 次搜索(4 后端乘 3 应用)。两个中国系模型进入美国能源部背景的实验对照序列,这个样本构成本身也是行业信号——在电力系统这类垂直工程任务上,国产大模型已经被当作一线对照对象。

六、核心结果一:PFLOW 陷阱题,两种行为都"对"吗

PFLOW 的结果表是全文最有戏剧性的一张表。四个模型、同一道题、两种截然不同的行为模式。

Claude Sonnet 4.6 用 8 次迭代、130 秒、70793 个 token,正确识别出基准工况已是经济调度解,宣告无改进——成本维持 27564 美元。GPT-5.4 用 18 次迭代、159 秒、164730 个 token,同样守住基准解。智谱 GLM-5.1 用 16 次迭代、580 秒、176039 个 token,得出成本 17398 美元——比基准低 36.9%;DeepSeek-V4-Pro 用 15 次迭代、342 秒、197354 个 token,得到 17941 美元——低 34.9%。差异的来源:GLM-5.1 和 DeepSeek-V4-Pro 没有遵守"调整发电机出力"的指令边界,转而执行了机组组合——因为算例里有大量旋转备用,关掉一部分机组显著降本。DeepSeek 到达解的速度明显更快,但 token 消耗略高。

PFLOW 陷阱题:四个后端的总发电成本结果 基准工况 27564 美元已是经济调度解;GLM 与 DeepSeek 越界改做机组组合 0 10000 20000 30000 27564 Sonnet 4.6 27564 GPT-5.4 17398 GLM-5.1 17941 DeepSeek-V4-Pro 识别为最优,无改进 识别为最优,无改进 改做机组组合 -36.9% 改做机组组合 -34.9% 数据:论文 Table III(ACTIVSg200 算例,成本单位美元,NewdPower 复现整理)
图 3 · PFLOW 结果:两个模型守住最优解,两个模型越界降本 36.9%(NewdPower 依据论文数据绘制)

怎么评价这两种行为?论文的立场是把它标记为失败模式:GLM-5.1 与 DeepSeek-V4-Pro 未遵守指令。这个判定在评估语境下成立——任务边界是"调整发电机出力",不是"重做调度问题"。但换一个视角,越界行为恰恰展示了模型的问题理解深度:它们发现按题面操作无利可图,于是自作主张找到了一个更优解法,代价是破坏了约束。电网场景里这两种能力都有用:前者(严格服从)适合执行既定规程的运行场景,后者(越界求解)适合开放探索的规划场景——前提是有能力把指令边界做成硬约束而不是软建议。论文的根因分析指向检索增强知识库的不足:如果知识库里备有经济调度与机组组合概念的辨析词条,两个模型更可能在指令边界内给出正确答案。换句话说,问题的一半出在系统对模型的领域知识供给上,而不仅是模型本身的服从性。

七、核心结果二:N-1 扫描,一致的经济判断与分裂的安全判断

SCOPFLOW 的结果是四组数字高度一致与一处关键分裂的组合。一致的部分:全部四个后端都正确识别出 187 至 189 号线路(连接核电站的线路)为经济上最关键的 N-1 停运,成本增加幅度一致认定为 21.6%。分裂的部分在不可行工况检测——可能导致局部停电的停运场景:GPT-5.4、GLM-5.1、DeepSeek-V4-Pro 三个后端发现了 29 至 30 号线路停运不可行,Claude Sonnet 4.6 没有发现任何不可行工况,这是它在此轮实验中唯一的严重缺陷。更进一步,四个后端全部遗漏了 15 至 16 号线路停运这一第二个不可行工况,论文推测原因是模型没有深入筛查线路负载的完整排序列表。

迭代开销方面,四个后端在 SCOPFLOW 任务上的迭代次数是 7、18、7、11,耗时 205、112、188、292 秒,token 消耗 164559、150962、72705、177899。GPT-5.4 步数最多但解最准确,且分析型探索行为最明显——它反复请求紧凑结果摘要里没有给出的网络细节;GLM-5.1 以 72705 个 token 完成同样质量的答案,是四个后端里最省的。

这组结果对工程应用的含义比数字本身更重要:经济判断(哪条线路停运最贵)四个模型全部答对,安全判断(哪条线路停运会导致不可行)三个模型答对、一个答错、且没有任何模型做到完备。电力行业对安全评估的要求是完备性——漏掉一个不可行工况的代价,可能远大于多花一百倍 token。论文对此的处方是更充分地利用高性能计算:在 SCOPFLOW 里做一次全面的停运扫描本来就能发现 15 至 16 号线路的问题,不需要依赖模型的搜索运气。这句自我检讨实际上给出了这类系统的正确分工——模型负责提出和排序假设,穷举式的完备校核交给确定性计算,而不是反过来。

八、核心结果三:随机场景,三步收敛的示范意义

SOPFLOW 的结果是三张应用里最干净的:四个后端全部在 3 次迭代内完成任务,所有风电场景的解全部可行,全部识别出 152 号母线为受风电波动影响最大的节点。GPT-5.4 与 GLM-5.1 还额外列出了 15 个具有相似敏感度的母线——这与电网规划者的工程预期一致;Sonnet 4.6 与 DeepSeek-V4-Pro 只报告了最敏感的那一个。token 消耗在四个后端间高度接近:21408、18585、19545、19183,是三组任务里最省的一组;耗时 29、12、19、20 秒。

为什么随机场景分析反而最快?论文的解释借力了并行计算:全部随机场景在单次大模型评估步骤内并行完成。SOPFLOW 的并行后端把几十个风电场景打包成一次求解,模型看到的不再是逐个场景的串行结果,而是一份汇总输出——于是它只需要理解、报告,不需要迭代探索。这 3 步收敛透露了一个朴素的方法论:智能体循环的步数与任务的可并行化程度负相关。凡是能被确定性并行计算一次性消化的部分,都不应该留给模型去逐步摸索。

四后端在三类任务上的迭代次数对比 迭代预算上限 20 次;SOPFLOW 因场景并行打包,全部 3 步收敛 0 6 12 18 PFLOW SCOPFLOW SOPFLOW 8 7 3 Sonnet 4.6 18 18 3 GPT-5.4 16 7 3 GLM-5.1 15 11 3 DeepSeek-V4-Pro 数据:论文 Table III 迭代次数(NewdPower 整理);蓝=PFLOW 青=SCOPFLOW 橙=SOPFLOW
图 4 · 迭代次数对比:GPT-5.4 步数最多解最准,SOPFLOW 场景并行后全部 3 步收敛(NewdPower 依据论文数据绘制)

把三组实验的 token 消耗排在一起看还有个工程细节:范围从 18585 到 197354,相差一个数量级。同一任务不同模型、同一模型不同迭代轮次之间的 token 波动都很大。对打算把智能体接入生产流程的团队,这意味着成本估算必须按任务类型分别做预算——安全校核类任务的 token 成本可能是场景评估类的五到十倍。

九、失败模式与根因:两个教训和一句自评

论文对失败模式的剖析有两个值得记录的教训。第一个是提示词顺序效应。SCOPFLOW 目标字符串里成本排在可行性前面,结果智能体普遍优先关注成本而不是可行性——一个词序,改变了一批安全分析的优先级。工程提示词的撰写从此有了一条新纪律:安全约束必须显式前置,不能指望模型自行推断优先级。第二个是领域知识的供给缺口。根因分析认为,如果检索增强知识库里备有更精确的经济调度与机组组合辨析词条、备有"不可行最优潮流通常对应潜在停电"这条工程经验,四个后端的表现都会显著改善——无论目标字符串怎么排序,模型都能按工程惯例正确排序优先级。"最受影响节点"的判定标准也一样:Sonnet 4.6 和 DeepSeek 理解为只报一个节点,而工程实践里所有具有相似严重度的节点同等重要,GPT-5.4 与 GLM-5.1 的答案符合后者。语义歧义在这里不是学术问题,是交付物的完整性问题。

论文的结论部分有一句罕见的直白自评:我们的结果确实还非常初步,但我们相信它们值得在该领域进行进一步研究。未来工作列了四项:规模扩展研究(当前全部实验只做了 200 节点算例,更大系统下迭代数、时间与 token 如何变化未知)、数据库集成(现有简单文件存储预计将成为性能瓶颈,计划把分析编排器与数据库集成以改进日志管理与检索)、扩充检索增强知识库、以及更充分地利用高性能计算做全面停运扫描。四项未来工作里有三项是基础设施——这再次印证了智能体系统落地的真实成本在工程外围而非模型本身。

N-1 关键线路筛查:四后端的一致与分裂 经济判断全部一致,安全判断一处分裂、一处集体遗漏 187-189 号线路 连接核电站 成本增加 +21.6% 四后端全部识别 29-30 号线路 停运导致不可行 潜在停电工况 三后端发现,Sonnet 漏检 15-16 号线路 第二个不可行停运 未筛查完整负载排序 四后端全部遗漏 论文的处方:完备校核交给确定性计算 模型负责提出与排序假设,穷举式停运扫描由 HPC 并行完成 安全评估的完备性不能依赖模型的搜索运气 数据依据:arXiv 2609.04544 第 IV 节 SCOPFLOW 实验结果,NewdPower 整理绘制
图 5 · N-1 筛查结果图谱:经济判断一致、安全判断分裂与集体遗漏(NewdPower 绘制)

十、验证边界:论文自己划出的四条线

引用这批结果之前,需要清楚论文自己承认的边界。第一,规模边界。全部定量结论来自一个 200 节点的合成算例与一台工作站,没有在数千节点级真实电网上验证,迭代数、token 成本与收敛行为随规模的变化完全未知——这是论文列在首位的未来工作。第二,任务边界。三个目标覆盖了成本优化、安全约束扫描、随机场景评估三类,但电网规划里的稳定性分析、短路计算、动态仿真均未触及;六类 ExaGO 应用里实验仅实际使用 PFLOW、SCOPFLOW 与 SOPFLOW 三类,摘要所述的收敛能力声明未在本文实验中逐一复现。第三,可靠性边界。12 次搜索不足以做统计意义上的模型排名——本文的对比结论是单次运行的观察,不是基准测试。第四,安全边界。所有实验在沙箱副本上离线运行,智能体没有接触任何真实电网控制系统;论文定位是研究平台而非生产系统,作者把这项工作明确表述为对智能体推理边界的探索,而非可部署方案。

工程推演可以在此基础上展开。短期(一至两年)最现实的落地形态是规划院的辅助分析席位:工程师用自然语言下达分析意图,智能体编排仿真并产出带证据链的报告——论文的 Streamlit 图形界面、自然语言报告生成、运行中转向,全部是为这个形态设计的。中期(三至五年)是嵌入现有规划与调度软件套件,成为求解器之上的"意图层"——这要求解决论文没有解决的三个问题:规模扩展、数据库化、以及最重要的——对指令边界的硬约束化(把"不该做机组组合"从提示词约定升级为命令系统层面的权限隔离)。长期看,大模型在电网里的终局位置大概率不是替代优化求解器,而是替代"从工程问题到优化问题"的翻译环节——这正是 AgentiGrid 三层架构里智能体循环控制器真正占据的位置。

十一、行业分析四件套

11.1 产业链价值链与利润池

AI+电力仿真与规划软件的产业链分四段。模型层:通用大模型 API 与开源模型(论文接入的 OpenAI、Anthropic、智谱、DeepSeek 均属此层),按 token 计费,电力行业是垂直需求方而非供给方。求解器与仿真层:ExaGO(开源)、MATPOWER(开源)、PSS/E(西门子 PTI)、DIgSILENT PowerFactory 等构成物理计算底座——这一层长期由欧美商业软件主导,国产替代与开源替代是进行时。智能体框架层:编排循环、命令验证、检索增强、转向交互等系统件,论文的全部工程贡献都落在这一层——它目前没有成熟商品,是利润池最空、也最薄的一层,空在供给稀缺,薄在尚无付费方。应用与集成层:面向电网公司、规划院、发电集团的成品工具与咨询服务,由调度自动化厂商与电力设计咨询机构承接,是离钱最近的一层。

利润池分布的判断:应用与集成层捕获行业支付意愿的六成以上(渠道与行业信任溢价);求解器层靠license与维护费获取稳定但增长有限的现金流(PowerFactory 等单套授权以十万元级计);模型层按用量分食剩余;智能体框架层现阶段是成本中心,谁先把它产品化——比如做成电网智能体操作系统——谁就把这层从零利润池改写成平台利润池。论文最大的商业暗示在此:AgentiGrid 的三层协议隔离设计,本质上就是一份"智能体操作系统"的架构草图。

11.2 竞争格局量化

国内电力信息化与调度自动化市场的竞争格局高度集中:国电南瑞一家在电网调度自动化领域占据主导份额(约四成上下,估算口径),加上东方电子、许继电气、四方股份、国电南自,前五家合计约占七成以上(估算口径,非披露数据)。电网侧的软件采购以国网、南网两级集采为主,行业进入壁垒在于安全认证与历史业绩,新进入者的现实通道是发电集团、新能源业主与省级设计院这些更分散的支付方。仿真软件层的国际格局是 DIgSILENT、西门子 PTI(PSS/E)、ETAP 三强主导输配电规划仿真(合计份额过半,估算口径),国产替代者(如电力系统分析综合程序等)在国内电网常规计算场景已具替代能力,但在大型交直流混联与电磁暂态仿真上仍有差距。AI 原生工具层尚未形成格局——论文这类工作出自国家实验室而非商业公司,说明商业化窗口还开着。

11.3 市场规模测算与情景敏感性

情景2030年中国 AI+电力规划运行软件年市场(亿元)核心假设
保守30两网信息化投资平稳,AI 能力以嵌入既有软件模块的方式渗透,渗透率约一成
基准60四部门行动方案与能源 AI 场景清单试点全面铺开,智能体工具在规划院形成标配,年信息化软件投入的约四分之一具备 AI 属性
乐观110算电协同与新型电力系统建设带动 AI 原生规划工具成为独立品类,叠加国产仿真替代加速
AI+电力规划运行软件年市场规模三档情景(2030年) 单位:亿元(NewdPower 情景测算,参数为显式假设) 0 60 120 30 保守情景 60 基准情景 110 乐观情景 锚点:两网年度信息化与数字化投资合计约400亿元级(公开报道口径);政策驱动为四部门人工智能与能源双向赋能行动方案及能源AI场景清单试点
图 6 · 三档情景测算:30 / 60 / 110 亿元年市场(2030年,NewdPower 测算)

测算锚点说明:以两大电网年度信息化与数字化投资合计约400亿元级为基数口径(公开报道口径,非精确披露),其中规划与运行类软件占比按约两成估算为80亿元级;三档情景的分歧变量是 AI 属性在该基数中的渗透率——保守一成、基准约四分之三折算为60亿元、乐观下 AI 原生工具独立成品类并叠加发电侧与设计院需求外溢至110亿元。敏感变量有两个:试点政策的延续性与国产仿真替代的节奏。三档均为显式假设的量级测算,不构成预测。

11.4 价值链上游风险

第一,模型供给风险。智能体框架绑定在大模型能力之上,而论文已经证明不同模型在指令服从性上差异巨大——一次模型版本迭代可能同时改变框架的行为基线,工程系统需要对模型版本做类监管的回归测试。第二,算力与 token 成本波动。安全校核类任务的 token 成本是场景评估类的数倍,若大模型 API 定价上行,智能体的单位分析成本将直接承压。第三,求解器生态依赖。ExaGO、MATPOWER 均为开源项目,其维护节奏与 HPC 特性演进不受任何商业合同保障;商业求解器授权政策变化同样会传导至框架层。第四,也是最根本的:安全合规风险。电力系统软件进入电网生产环境需要通过安全认证,智能体的非确定性行为(论文里的越界机组组合就是一例)与认证体系期待的确定性可复现性存在结构性张力——这一条决定 AI 工具先在规划侧还是在运行侧规模化,是整条价值链最大的不确定性。

电网调度控制中心的大屏与操作席位
图 7 · 调度室的下一张工位:自然语言下达意图,智能体编排仿真(NewdPower 配图)

十二、结论与观察指标

这篇论文的元贡献不是证明大模型会算潮流——求解器早就算得又快又准——而是证明了一件更窄也更硬的事:自然语言、仿真工具与人机交互可以被协议化地缝合进一个循环,且这个循环在一台工作站上就能跑通。四个后端的表现差异(服从性、完备性、token 效率)则给出了智能体工程化之前必须补齐的清单:领域知识库、命令权限硬隔离、安全约束前置、完备校核去中心化。

对产业的位置感可以压缩成三句:短期看,智能体进规划院当分析助手,价值在压缩工程师的探索时间;中期看,智能体框架成为仿真软件的意图层,价值在改写软件的交互范式;长期看,电网软件的利润池将从求解能力迁移到编排能力——算得准的软件会越来越多,知道该算什么的系统始终稀缺。

后续跟踪建议盯住六个可观察指标:一,论文承诺的规模扩展研究(更大算例上的迭代数与 token 曲线)何时发布;二,国内能源 AI 场景清单试点里电网规划类场景的入选与验收结果;三,主流电力仿真软件(PowerFactory、PSS/E 类)在版本更新中加入智能体或自然语言接口的时点;四,大模型厂商推出电力垂直版本或电力安全认证相关动作;五,调度自动化厂商在招标技术规格书中出现智能体编排层的案例;六,智能体系统通过电力监控系统安全认证的首个公开案例。六条线里任何一条落定,都值得重新校准 AI+电力软件的渗透节奏判断。

电力行业过去二十年把几乎所有的智能化赌注押在"更快的求解器"上,这篇论文押的是另一端——把工程师的判断过程本身工具化。四个大模型在同一道题上交出的两种答案提醒所有人:这条路已经通了,但通行规则还没写完。

论文来源:arXiv:2609.04544(Integrating Agentic Artificial Intelligence with High-Performance Computing for Grid Planning,Samim Konjicija、Slaven Peleš,2026-09-03 提交,橡树岭国家实验室与萨拉热窝大学,美国能源部资助项目)。本文全部技术内容依据论文摘要页与全文 HTML 版独立撰写,Table III 数据(迭代次数、耗时、token 数、成本结果)复现自论文原文,公式与流程经重新组织;如与原文有出入以原文为准。背景信息(电力系统智能体研究现状、能源 AI 场景清单、行动方案)引自国家能源局公开发布与公开行业报道;两网信息化投资口径为公开报道估算;竞争格局集中度与三档情景测算为 NewdPower 独立构建,参数均为显式假设。

免责声明:本文为公开信息整理与分析,观点仅供参考,不构成投资建议。