端侧大模型,就是直接跑在你手机或电脑本地、不联网也能用的 AI 模型。2026 年它确实在落地,但落地的方式和厂商发布会上的口号之间,隔着一道很硬的内存墙。这篇文章用"端侧三问"——能不能跑、跑得好不好、值不值——把真相拆开看。结论先放这:端侧是大方向,但被营销夸大了;今年处在"轻任务放端侧、重任务端云协同"的阶段,"把 70B 模型塞进手机"目前是假的。


一、端侧大模型能不能跑:内存墙比芯片更硬

决定你能不能跑端侧大模型的第一道关,不是芯片多强,而是机器里有多少内存(RAM)。模型参数要占地方,量化(把数字从高精度压成低精度)能省空间,但省不到违反物理规律。

先算一笔可核算的账。按 FP16 精度,每 10 亿参数大约占 2GB;按 INT4 量化,每 10 亿参数大约占 0.5–0.6GB。于是:1B 模型 INT4 约 0.5–1GB,3B 模型 INT4 约 1.8–2GB,7B 模型 INT4 约 3.5–4.2GB;若用 FP16,7B 要 14–16GB,根本装不进 8GB 的手机。

图片

硬件门槛对比梯级/条形图——纵轴为内存占用(GB),依次标出 Apple 8GB 统一内存门槛、骁龙端侧上限约 13B、7B INT4 约 4GB、70B…

苹果这条线最常被误传。Apple Intelligence 的门槛是 8GB 统一内存加 A17 Pro 起,iPhone 15 Pro 那台 8GB 的机器就支持——"必须 16GB"是谣言。端侧跑的是约 3B 的模型(2-bit 量化加 KV 共享),速度约 30 tokens/s;更复杂的活交给 Private Cloud Compute(PCC,私有云计算)。到 2026 第三代,苹果新增 AFM3 Core Advanced(20B 稀疏端侧先进模型)和 AFM3 Cloud Pro,端侧的盘子明显在变大。

高通这边,骁龙 8 Elite 的 Hexagon NPU,端侧参数上限约 10–13B(INT4 量化)。7B 的 Llama 跑下来约 20 tokens/s,3B 小模型峰值能到 220 tokens/s。这里要专门纠正一句:坊间传"端侧能跑 70B",不实。70B 即便按 INT4 也得约 35–42GB,没有任何手机装得下。

内存是硬约束。70B 模型就算压到 INT4 也要近 40GB,手机的物理内存装不下,所谓"70B 装进手机"目前是假话。


二、端侧大模型跑得好不好:能力边界划得很清

能装进去,不代表什么都能干。端侧 1–3B 模型是"够用型选手",不是"全能型选手"。

能胜任的活很明确:文本摘要、改写、简单对话、分类、短工具调用。vivo 给过一个可参考的数字——他们 3B 模型的文本摘要效果约为云侧模型的 97–98%。这是个很诚实的表态:接近,但承认差距存在,"够用"不等于万能。

做不好的活同样明确:复杂推理、长上下文(超过数千 token)、多步 Agent、知识更新。Agent 说白了就是"让模型自己分解任务、连续调用多个工具去完成一件事",这件事端侧现在扛不住;知识更新要吃实时数据,端侧也兜不住。这些仍要云端兜底。

图片

端侧 vs 云端能力边界矩阵双栏图——左栏"端侧能跑"列摘要/改写/简单对话/分类/短工具调用,右栏"必须云端"列复杂推理/长上下文/多步 Agent/知…

把厂商的端侧模型摆出来看更清楚。Google 的 Gemini Nano 随 Pixel 9/10 首发,走 Android AICore 系统服务,能力覆盖摘要、改写、校对、图像描述、智能回复、离线使用;确切参数量 Google 没一手公开,业界引用 Nano-2 约 3.25B,属未完全核实(媒体转述)。Meta 的 Llama 3.2 给了 1B/3B 端侧纯文本版,128K 上下文、支持工具调用,3B INT4 约 1.8–2GB;注意 Llama 3.2 Vision 的 11B/90B 需要桌面 GPU 或云,不是端侧。

国产这边参数多数来自发布会或媒体转述,正文都标为"厂商宣称":华为小艺融合盘古加 DeepSeek、走端云一体;荣耀 MagicGUI 7B 多模态,落地 Magic V5;vivo BlueLM-2.5-3B 是端侧多模态;OPPO AndesVL 有 0.6B–4B 四档;小米 MiLM/MiMo 是矩阵式布局,但"MiLM 130 亿端侧"说法存疑,已经超过端侧内存的物理上限。


三、端侧大模型值不值:渗透度与营销水分

值不值,看的是真实场景里它到底解决了什么,又夸大了什么。

真实解决的部分:离线可用、隐私不出本机、响应快、不花云端调用费。摘要、改写、智能回复这类高频轻任务,端侧确实已经能稳定接住,用户日常感知得到。你飞机上没网,手机照样帮你把长邮件缩成三行重点,这就是端侧的价值。

被夸大部分:把"端侧本地"包装成"全知全能本地 AI",暗示所有智能都不用上云。事实是行业主流方案是"端侧轻量化(2–5B,多为云端蒸馏出来的小模型)加 API 接云"的混合路线。端侧干轻活,云干重活,中间靠路由决定谁上。

图片

厂商端侧布局一览卡片/表格——Apple(3B+PCC,2026 增 20B 稀疏)、Qualcomm(端侧上限约 13B)、Google(Gemini …

端云协同怎么做,各有各的聪明。苹果 PCC 走"无状态、可验证透明"的路线,端侧 4K 上下文无限次离线、PCC 给到 32K 但有每日限额。华为做端云快慢思考的自适应路由,简单问题本地快答、难题交云深想。这比单纯喊"本地 AI"要实在得多。

2026 的真相是:轻任务端侧化、重任务端云协同,中间由路由智能分配,不存在"纯端侧替代云端"的拐点。


收束:端侧大模型是趋势,但不是神话

把三问串起来:能不能跑,看内存,8GB 手机装得下 3B、装不下 70B;跑得好不好,1–3B 接住轻活、重活交云;值不值,轻任务真香、全能叙事是泡沫。端侧大模型是确定性的大趋势,但从"能跑"到"好用"再到"替代云",中间每一级台阶都要跨过真实的内存与算力约束。

给普通用户一句实在话:买手机别被"本地 AI"的宏大叙事带偏,盯住你常用的那几样轻功能——摘要、改写、离线回复——它们已经真落地;至于"不用联网的万能助手",2026 还不存在。

端侧大模型会越来越大、越来越能打,但今年它最诚实的样子,是和云端各司其职,而不是单挑云端。

这篇拆解对你判断厂商话术有帮助的话,欢迎留言说说你最在意的端侧 AI 功能,或点个收藏备用。

更多推荐