前言

我们上回说到,基于多模态大模型给现实世界加了一本说明书,后端开了一台服务器做推理服务(只是省了token)。

随着技术的发展,这次我们尝试直接在手机侧运行大模型(把流量也省了)。

本文介绍如何在 OnePlus 12(骁龙 8 Gen 3,24GB RAM)上运行阿里最新的 Qwen3.5-0.8B 模型,通过 llama.cpp 框架实现本地推理。

Prompt 处理速度 33.3 t/s,生成速度 16.9 t/s。无需云端,隐私安全,随时随地享受 AI 加持。

📱 引言:把 AI 塞进口袋

想象一下:没有 API 调用限制,不用担心网络延迟,数据完全本地处理,你的 AI 助手随时待命——这一切,只需要一台安卓手机。

这不是科幻。

别再云端裸奔了,你的数据值得本地运行。

2026 年了,你还在把对话数据发给云端 API?

每次问个问题,隐私就在互联网上裸奔一次。更别提网络延迟、API 限流、服务宕机……

受够了。

我决定把大模型本地化——不是那种"云端 API 套壳"的假本地,是真正的端到端本地推理

🎯 项目背景:为什么要在手机上跑大模型

  • 隐私,没有之一。用户图像上传云端,合规风险高,即使用本地服务器,不可避免还是需要经过运营商。

  • 成本,云端的推理,即使上了 code plan 也压不住视频采集级别的token消耗;而在外旅游时,本地服务器也需要消耗大额的流量。

  • 延时,在一些需要高速追踪的场合,“外挂”大脑的延时还是太高了。

  • 算力,AI眼镜作为第一人称视角,有很强的沉浸感,但续航和算力实在太紧张了。随身设备中,算力最强的只有手机,而且人手一个。

  • 离线,地铁、地下停车场、电梯照样工作

凌晨两点,你问了一个难以启齿的问题。

没有服务器记录,没有数据上传,没有第三方窥探。答案只在你的屏幕亮起,然后熄灭,像从未存在过。

我们习惯了把思考外包。

问天气,问路线,问建议,问秘密。每一次提问,都是一次数据迁徙。你的困惑、欲望、焦虑,变成比特流,飞向某个不知名的数据中心。

它们说这是为了"更好的服务"。

但当你深夜搜索"如何缓解焦虑",第二天收到的却是抗抑郁药广告时,你开始怀疑:服务的是你,还是广告商?

曾经,隐私是富人的特权。

富豪请私人医生,不上传病历;请私人律师,不记录咨询;请私人教师,不留存对话。普通人呢?只能在条款里勾选"同意",然后把生活交给算法。

现在,技术把特权变成了权利。

当AI在本地运行时,对话止于设备。没有中间商,没有数据湖,没有"用于模型优化"。你的问题问出去,答案回来,然后消失。

就像从未发生过。

断网的那一刻,现代生活崩塌了。

地图不能导航,音乐不能播放,消息不能发送。我们像被切断脐带的婴儿,惊慌失措。

但本地AI不依赖网络。

地铁隧道里,飞机飞行中,山区露营时,它都在。没有"服务器维护",没有"请求超时",没有"今日配额已用完"。

离线不是缺陷,是自由。

你可以带着AI去任何地方,就像带一本书、一支笔、一个老朋友。它不联网,不汇报,不背叛。

本地AI最迷人的地方,不是性能,是主权

你可以让它说任何话,问任何问题,探索任何想法。没有内容审查,没有使用政策,没有"根据相关法律法规"。

它是你的工具,不是公司的产品。

你可以微调它,让它学习你的说话方式、你的知识结构、你的价值观。它不会变成通用助手,它会变成你的数字延伸

就像日记本,就像老照片,就像那把用了十年的吉他。

想象一下三年后的场景:

  • 手机里的AI记得你所有的对话,但不上传任何数据

  • 眼镜捕捉的画面,实时分析,实时反馈

  • 手表监测的健康数据,本地处理,本地建议

  • 所有设备互联,但数据不出你的控制范围

不是物联网,是"我的物"。

不是智能城市,是智能个人。不是大数据,是小数据——只属于你的数据。

这不是劝你放弃云端AI。

云端有云端的优势:更强的模型,更多的数据,更低的成本。有时候你需要它,就像有时候你需要图书馆、需要专家咨询、需要搜索引擎。

但选择权在你。

你可以选择什么时候用云端,什么时候用本地。什么时候分享,什么时候保留。什么时候连接世界,什么时候断开。

自由不是只用一种方式生活,是可以选择。

🔥 Qwen3.5-0.8B 介绍

Qwen3.5 系列是阿里云 2025 年推出的最新一代语言模型,0.8B 版本专为移动端设计:

  • 架构:Transformer Decoder-only

  • 上下文:32K tokens

  • 词表:151,936 tokens

  • 训练数据:2.5T tokens

效果的确很惊艳,主要是推理速度极快,AGI 能力优于之前的 LLaVA 太多。天下武功唯快不破,LLM 的速度再提升一些,很多端侧的本地模型就没有必要存在了(泛化能力不能比)。

📸AI眼镜

  • 第一人称视角拍摄,轻量化,不影响日常工作

  • 小米眼镜对开发者支持不足,没有找到无线获取眼镜上视频流的方案

  • 长时间拍摄,眼镜的续航远不如手机,最终采用 USB 方案(顺便可以补电)

    为什么没有手机设计2个Type-C接口?

🛠️ Termux 编译 llama.cpp 实战

Termux 是 Android 上的终端模拟器,提供完整的 Linux 环境。可以安装 gcc、python、git 等工具,相当于把手机变成迷你服务器。

采用 termux 方案可以分离大模型和具体应用APP,单机可用 127.0.0.1 访问保证安全,跨机协作可以暴露 IP,提供为本地算力,灵活度和兼容性都是最佳。

https://f-droid.org/en/packages/com.termux/

其他的端侧方案,让龙虾团队也同时测试了一下,目前很多还没有支持 qwen 3.5 新架构(比如ONNX,MNN)

排名 框架 Qwen 支持 性能 推荐度
1 MNN ⭐⭐⭐⭐⭐ 官方支持 最优 ✅ 首选
2 MLC LLM ⭐⭐⭐⭐⭐ 原生支持 优秀 ✅ 备选
3 llama.cpp ⭐⭐⭐⭐ GGUF 良好 ⚠️ 需移植
4 NCNN ⭐⭐⭐ 社区 一般 ❌ 不推荐
5 ONNX ⭐⭐⭐⭐ 良好 中等 ⚠️ 包体大

image-20260322161348368

image-20260322182405395

前端 APP 采用通用 API 方式接入,按需切换云端,自部署或是手机算力。

量化方案

我们使用 GGUF 格式(llama.cpp 原生支持),由于手机资源足够,当前采用的是F16,还有多种量化精度可选:

量化 大小 精度损失 推荐
Q4_K_M ~500MB < 1% ✅ 平衡
Q5_K_M ~600MB < 0.5% 高质量
Q3_K_M ~400MB ~2% 省空间

vibe coding 时代,具体技术细节和代码就不发了(详见开源地址)

https://github.com/bluishfish/AIGlasses-local

懒得折腾的,也可以在公众号末尾链接,直接下载编译好的程序。

好吧,以上场景都是 AI 编的,整篇文章也充满了AI味。当 Agent 在跨领域的时候,比我们表现的更好了。我们应该在专业度上更上一层,才能真正地解决模型幻觉问题。

避雷

这里列出过程中遇到的几个小坑

image-20260322181937122

  • llama-cli 可以直接手机上编译(必须开启跳过测试程序

    -DLLAMA_BUILD_TESTS=OFF

  • llama-server 在termux中编译通不过,可以选ndk交叉编译

  • opencl版本的GPU加速可行,但受限于termux发挥不出作用(开发者选项指定驱动程序

    image-20260322180914861

  • Android中要对termux设置后台不休眠

    image-20260322181858577

    image-20260322154905822

    termux-wake-lock

  • termux中开启共享目录来访问模型文件

    termux-setup-storage

  • qwen3.5的架构改动很大,转换格式的时候需要指定

    model type=none

  • 视频的分辨率过高,直接放入大模型速度太慢(带思考推理1分钟以上),需要加前置预处理

  • 高分辨率图片可以当ocr用,低分辨率则不行,而且推测的地点大概率是脑补(幻觉)

    image-20260322182328960

    image-20260322182333628

    image-20260322182323127

    image-20260322182129888

    image-20260322182147100

  • 二维码是无法识别的(幻觉)

image-20260322182302681

image-20260322182307681

image-20260322182312465

  • 最后看一下外景实测的图片,感受一下模型能力

    image-20260322181452553

    image-20260322182158167

    image-20260322182203593

    image-20260322182210656

    image-20260322182215827

    image-20260322182226301

    image-20260322182231456

    image-20260322182240862

    image-20260322182245830

    image-20260322182250889

    0.8b的表现已经足够惊艳,而24g内存的手机最多可以跑35b模型,要速度还是质量,都行。

    多人旅游的场景,还能临时当智能热点,给团队的人员提供大模型服务。

    image-20260322190829410

    若是远程自部署推理,0.8b 图像推理不到1秒。达到接近实时推理,这想象力就很大了。

    最后,把这模型接入龙虾,一堆skill加强,有趣的事情开始了...

    image-20260322155508999

    image-20260322155552707

    源码下载

    image-20260322183723190

    本期相关文件资料,可在公众号“深度觉醒”,后台回复:“aiglasses”,获取下载链接。

更多推荐