最近几个月,"AI PC"的概念被炒得火热,尤其是 AMD 锐龙 AI 系列处理器,凭借集成的专用 NPU(神经网络处理单元),让不少玩家心动不已。很多人问我:“只靠这颗 NPU,能不能在本地流畅跑大模型?是不是买了锐龙 AI 就不需要独立显卡了?”为了搞清楚这个问题,我特意入手了一台搭载最新锐龙 AI 9 HX370 的轻薄本,配合 Ollama 和 LM Studio 进行了一系列“极限压力测试”。结果既让人兴奋,也让人清醒:端侧 AI 确实来了,但它的能力边界比你想象的要清晰得多。

当 NPU 遇上“巨无霸”:一次失败的尝试

测试的第一步,我试图挑战极限。既然宣传都说 NPU 算力高达 50 TOPS,那跑个参数量巨大的模型应该没问题吧?我直接在 LM Studio 中加载了一个未量化的 72B 参数大语言模型。

结果令人尴尬:模型加载进度条卡在 40% 就再也动不了了,随后系统提示内存不足(OOM)。即使我换成了经过 4-bit 量化的版本,虽然勉强加载成功,但生成速度却慢得惊人——大概每 15 秒才能蹦出一个字,而且风扇狂转,机身烫手。查看任务管理器发现,此时主要干活的竟然是 CPU,NPU 的利用率几乎为零,而集成显卡 Radeon 780M 也在满负荷挣扎。

这次失败复盘很直观地揭示了一个残酷现实:NPU 不是万能钥匙。 超大参数模型对显存容量和内存带宽的要求极高。锐龙处理器的 NPU 虽然算力强,但它通常共享系统内存。当模型体积超过显存或内存带宽成为瓶颈时,单纯依靠 NPU 根本无法维持实时推理。对于想要本地运行 70B+ 级别“巨无霸”的用户来说,仅靠集成 NPU 是远远不够的,你必须依赖拥有大显存的独立显卡(如 Radeon RX 7900 系列或更高),或者接受极低的推理速度。

内存带宽:被忽视的隐形杀手

在测试中等规模模型(如 Llama 3 8B、Qwen 7B)时,我发现了一个有趣的现象:即便模型能跑起来,推理速度(Token/s)也远没有达到理论峰值。经过深入分析,问题出在内存带宽上。

锐龙 AI 架构中,NPU、CPU 和 GPU 共享同一块 DDR5 内存。大模型推理是一个典型的“内存密集型”任务,数据需要在内存和计算单元之间频繁搬运。如果内存频率不够高(比如只有 5600MHz),或者通道数受限,数据供给速度就会跟不上 NPU 的计算速度,导致 NPU 经常处于“等米下锅”的闲置状态。

这就解释了为什么在某些配置下,哪怕 NPU 标称算力很高,实际跑分却不如预期。这也给选购者提了个醒:如果你打算用锐龙 AI 跑本地模型,务必选择高频双通道甚至四通道内存的版本,否则再强的 NPU 也会被带宽拖累成“半成品”。

找准定位:NPU 的真正主场在哪里?

既然跑大模型有局限,那锐龙 NPU 是不是就没用了?恰恰相反。在调整策略后,我将测试重点转向了轻量级任务和特定场景,这才发现了 NPU 的“甜蜜点”。

当我使用 Ollama 运行量化后的 3B~7B 小模型(如 Phi-3、Gemma 2B)进行日常问答、代码辅助或文档总结时,体验发生了质的飞跃。在这些场景下,NPU 展现出了惊人的能效比:

  • 流畅度达标:生成速度稳定在 20-30 token/s,完全满足阅读和交互需求。
  • 静音低温:相比调用 GPU 时风扇的呼啸声,NPU 工作时整机几乎无声,表面温度也仅微温。
  • 续航无忧:拔掉电源后,电池续航时间几乎没有明显下降,这对于移动办公至关重要。

此外,在一些非生成式 AI 任务中,NPU 的表现更是无可替代。例如视频会议中的背景虚化、眼神接触矫正,以及本地的实时语音转录(Whisper 小模型),NPU 都能以极低的功耗实现实时处理,而把宝贵的 GPU 资源留给游戏或渲染任务。

建立 realistic 的预期:GPU 与 NPU 的分工

经过这一轮实测,我们可以为锐龙处理器的端侧 AI 能力画出一条清晰的界线:

  1. 轻量级推理交给 NPU:参数量在 7B 以下、经过量化的小模型,以及持续的后台 AI 任务(如语音助手、会议增强),是 NPU 的绝对主场。它能提供最佳的能效比和用户体验。
  2. 重型创作必须靠 GPU:一旦涉及图像生成(Stable Diffusion)、视频超分、或者运行 14B 以上的大模型,集成显卡 Radeon 的性能就显得捉襟见肘,更别提 NPU 了。这时候,你需要的是强大的独立 GPU 来提供充足的显存和并行计算能力。
  3. 混合调度是未来:目前的软件生态(如 Windows Copilot+)正在尝试智能调度,将简单任务扔给 NPU,复杂任务甩给 GPU。但在实际使用中,手动指定后端(在 LM Studio 中选择 Vulkan 或 ROCm)往往能获得更可控的结果。

总的来说,锐龙处理器的 NPU 绝对不是营销噱头,它确实让本地 AI 变得触手可及,但它也不是“银弹”。对于普通用户,它能带来更智能、更私密的日常体验;但对于追求极致大模型能力的发烧友,它更多是一个有益的补充,而非替代品。认清这一点,才能在选购硬件时不交智商税,真正享受到端侧 AI 带来的便利。

200小时GPU算力已就位,快来领取:https://marketing.csdn.net/questions/Q2604140858304426315?utm_source=AIpaper

在这里插入图片描述

Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐