大模型推理的下一笔账,不只是延迟和吞吐,还有电
论文:PALS: Power-Aware LLM Serving for Mixture-of-Experts Models
原文:https://arxiv.org/abs/2605.21427
一句话先看懂:PALS 这篇论文最现实的一点,是它终于把 GPU 功耗上限当成可调参数,而不是天经地义的背景条件。

做大模型推理的人,其实都知道一件事,线上系统不只在烧显卡,也在烧电。
但很奇怪,过去很多 serving 系统在优化吞吐、优化延迟、优化 batch、优化并行的时候,对功耗这件事的态度却更像“背景条件”,很少真的把它当成控制变量。
PALS 这篇论文,终于把这个账本翻了出来。
论文速读
这篇 paper 最现实的一点,是它终于把 GPU 功耗上限当成可调参数,而不是背景噪声。
前半篇先把问题摆出来,在线 serving 优化过去大多盯吞吐和延迟,电这笔账一直被放在后面。中段的方法部分则开始从 power-aware 的角度重新看 MoE serving,让调度策略直接考虑能耗约束。

后半篇实验真正要回答的是,功耗感知之后,性能和能耗之间能不能找到更聪明的平衡。整篇论文都在讲一件事,大模型推理的下一笔账,不止是快不快,还有耗不耗电。
所以它留下来的启发很清楚,serving 调优以后会越来越像一场综合预算优化,而不只是速度优化。
它到底在解决什么问题
做大模型推理的人,其实都知道一件事,线上系统不只在烧显卡,也在烧电。
但过去很多 serving 系统在优化吞吐、优化延迟、优化 batch、优化并行的时候,对功耗这件事的态度更像背景条件,很少真的把它当成控制变量。
问题是,一旦进入持续高负载生产环境,电就不是财务后话,而是系统设计约束。尤其 MoE 这种本来就有复杂激活路径的模型,功耗波动会直接影响可用性和成本。
PALS 想解决的,就是这种“大家都知道电贵,但系统里没人认真管电”的状态。

它的方法,为什么值得看
这篇论文的核心,是把 power-aware 直接带进 MoE serving 调度里。
这很重要,因为它意味着优化目标不再只是请求快不快、卡用没用满,而是要在速度、吞吐、功耗之间一起找平衡。很多过去默认不可碰的硬约束,现在被拉进了可调度空间。

这种视角一变,系统策略也会跟着变。你不是单纯问“怎么跑更快”,而是问“在给定功耗预算下怎么跑得最好”。这会让 serving 从单目标优化转向多目标优化。
这篇论文值钱的地方,就是它把这笔现实账第一次讲得很像工程问题,而不是附属问题。
对开发者和企业来说,这意味着什么
对基础设施团队来说,这篇论文的启发非常直接,以后推理系统的调优指标里,功耗会越来越难被排到最后。
谁能更早把 power-aware 策略做进平台,谁就更有机会在同样资源预算下把服务跑得更稳。尤其当规模上来以后,节能不是锦上添花,而是能不能持续扩容的基础条件。
对企业来说,这也意味着一件现实的事,大模型服务竞争力不只是模型精度和延迟,还有长期电费和机房预算。账一旦算长,就没人能假装电不存在。
所以我会把 PALS 看成 MoE serving 工程成熟化的一步,系统优化从此要把电费也算进去。
如果你觉得多模型切换 Q、工具订阅的流程太繁琐,也可以试试我们的「胜算云」平台,一站式搞定AI创作与开发相关需求。官网:https://www.shengsuanyun.com/?from=CH_5VQOF8WB
更多推荐
所有评论(0)