本文整理自 AICon 上海 2026 井晨哲分享《高效端侧大模型的技术趋势与产业应用观察》,通过AI音视频总结工具 Ai好记 进行转录整理,以下为精炼整理后的内容。

在这里插入图片描述

Scaling Law 之外的另一条路

大模型领域,Scaling Law 是共识:参数变大、数据增多,模型越来越聪明。GPT-4 到 GPT-5,参数量从 1T 跃升到 5T 级别,算力消耗指数级增长。

但面壁智能在 AICon 的分享中提出了另一个视角:效率问题不可忽视。 算力增长背后是资源消耗、环境成本和经济效益的问题。如果一味追求大模型,谁来买单?

他们从终端算力的角度切入,看到了另一条路。

终端算力的潜力和历史的启示

全球有 13 亿台 PC 和 70 亿部手机。大集群的算力扩展面临物理瓶颈,但终端设备的算力总和是极其庞大的。

类比计算机发展史:IBM 董事长沃森当年说世界上只需要大型机。最终驱动信息革命的却是小型机。这个逻辑放在大模型时代是否成立?面壁智能的答案是肯定的。

摩尔定律揭示,芯片的算力能力每隔固定时间就会翻倍。而在大模型领域,井晨哲的团队发现了类似的规律。

知识密度定律

他们定义了一个概念:知识密度——单位模型参数所对应的智能水平。背后的思考很朴素:人脑大约一公斤,比人脑大的动物有很多,但都不如人聪明。这说明结构密度比绝对规模更重要。

通过衡量全球所有开源模型,他们发现了具体的规律:每隔 100 天左右,实现相同智能水平所需的参数量减半。

这个规律被正式定义为「大模型的知识密度定律」,相关论文发表在《Nature Machine Intelligence》期刊封面。

三个推论

推论一:实现特定智能的模型参数指数下降。 最直观的例子是 MiniCPM-1-24B,仅 0.9B 参数就达到了 GPT-4 水平的智能。两年前被认为是行业门神的智能水平,现在可以跑在手机上。

推论二:模型推理开销指数级下降。 参数量下降直接导致推理成本降低。井晨哲的建议是:如果今天需要 GPT-4o-mini 或 Claude-3-haiku 级别的模型就能做的事,大胆去做——过两年经济模型会完全超乎预期,成本极低。

推论三:模型训练开销随时间下降。 训练成本由参数量、数据量和训练效率共同决定。参数量下降,训练成本也会自然降低。这为终端私有化、分布式部署提供了理论基础。

巧合的是,Sam Altman 和 OpenAI 内部也有类似的发现——虽然不叫同一个名字。

端侧智能的技术可行性

两条曲线决定了端侧智能的现实性。

  • 红线:相同智能水平所需模型尺寸持续下降(知识密度定律);
  • 蓝线:芯片承载能力持续上升(摩尔定律)。

两条线不断交汇,意味着越来越好的智能可以放在越来越小的终端上。

井晨哲给端侧智能下的定义是:在受限的硬件环境中,满足效率、隐私计算、高能效比、低成本的要求。应用优势包括实时响应、个性化和隐私安全。

从信息本质的角度看,自然语言模型带来了全新的交互范式,但硬件还没有完美适配。

比如 Web Coding 场景下,键盘输入其实是不本质的——你应该是想什么就说什么,而不是先想好再打字。

端侧设备的三大优势:

  1. 隐私性(信息不上云)
  2. 实时性(24 小时服务)
  3. 可靠性(不依赖网络)。

商业模式的思考

互联网时代有三种典型商业模式:按量付费(云服务)、广告获客+注意力消费(APP)、一次性买断(硬件)。

硬件的商业逻辑比较特别:用户倾向于多用,单位成本下降。硬件本身成为高黏度、个性化应用的最佳载体。端侧大模型的落地,硬件端的商业模式可能比纯云端方案更具可持续性。

高效大模型的技术体系

面壁智能提出高效大模型的六个技术方向,核心思路很明确:不是跟大厂比堆参数,而是在有限资源下做密度更高的智能。Apple 将模型作为标准化接口开放给开发者,也验证了端侧智能是行业趋势。

总结

知识密度定律给大模型行业提供了一个和 Scaling Law 互补的视角:不是所有场景都需要云端大模型,把合适的模型放在合适的终端上,可能是更务实的路线。对于做端侧 AI 应用的产品团队,这个方向值得关注。


以上内容由AI音视频总结工具 Ai好记 进行转录整理。
Ai好记是一款由清华团队研发的音视频转图文笔记的AI助手,支持B站、抖音、小宇宙等平台链接及本地、网盘音视频文件解析,转写后自动生成精华速览、思维导图和结构化笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

更多推荐