炸裂!Bonsai 27B 发布:全球首个可在手机上运行的 27B 参数大模型
2026 年 7 月 14 日,PrismML 正式发布 Bonsai 27B,基于 Qwen3.6-27B 的 1-bit 二进制 / 1.58-bit 三值量化模型,仅需 3.9GB 即可在 iPhone 17 Pro 上以 11 tok/s 流畅运行,成为首个能在手机上运行的 27B 级大模型!
一、引言:大模型本地部署的"不可能三角"
自从大语言模型(LLM)进入"百模大战"时代以来,开发者始终面临一个"不可能三角":
模型性能(越大越好)
/\
/ \
/ \
/______\
内存占用(越小越好) 推理速度(越快越好)
一个 27B 参数的模型在 FP16 精度下需要 54GB 内存,即使经过 4-bit 量化(如 GGUF Q4_K_M),仍然需要 18GB 左右 的显存 —— 这意味着普通笔记本跑不动、手机更不可能。
直到 Bonsai 27B 的出现。

二、Bonsai 27B 技术解析:什么是三值量化?
2.1 传统量化 vs 三值量化
传统模型权重使用 FP16(16 位浮点数)存储,每个权重占 16 位。量化就是降低这个精度:
| 量化方式 | 每位占位 | 27B 模型理论大小 | 可运行设备 |
|---|---|---|---|
| FP16(原始) | 16 bit | ~54 GB | 数据中心 GPU |
| INT4 (Q4_K_M) | 4 bit | ~18 GB | 高端显卡(24GB+) |
| INT2 (IQ2_XXS) | 2.8 bit | ~9.4 GB | 部分笔记本 |
| 三值 (Ternary) | 1.71 bit | ~5.9 GB | 普通笔记本 |
| 二值 (Binary) | 1.125 bit | ~3.9 GB | 手机 |
Bonsai 27B 的核心创新在于:每个权重不再是 0~65535 之间的浮点数,而是仅取 {-1, 0, +1} 三个值之一。
数学上看,log₂(3) ≈ 1.585 bit,加上每 128 个权重共享一个 FP16 缩放因子,实际有效位宽仅为 1.71 bit/weight —— 比 FP16 缩小 9.4 倍。
2.2 两个版本:灵活选择
Bonsai 27B 提供两个版本:
| 版本 | 位宽 | 理论大小 | 部署大小 | 性能保留 | 目标设备 |
|---|---|---|---|---|---|
| 三值版 (Ternary) | 1.71 bit | 5.9 GB | ~7.2 GB | 95% | 笔记本、桌面 |
| 二值版 (1-bit) | 1.125 bit | 3.9 GB | ~4.5 GB | 90% | 手机、平板 |
两个版本均采用 端到端低比特架构——从 Embedding、Attention 投影、MLP 投影到 LM Head,所有层都使用低比特表示,没有"高精度逃生舱"。
三、性能表现:压缩 10 倍,智能不缩水
很多开发者会担心:压缩这么狠,模型还"聪明"吗?
我们直接看 15 项基准测试(Thinking Mode)的结果:
3.1 数学与推理
| 基准测试 | Qwen3.6 27B (FP16) | 三值版 | 二值版 |
|---|---|---|---|
| GSM8K | 95.30 | 96.06 | 93.63 |
| MATH-500 | 99.40 | 99.20 | 98.40 |
| AIME25 | 93.29 | 90.84 | 80.53 |
| AIME26 | 93.33 | 87.50 | 80.00 |
注意:在 GSM8K 上三值版甚至超越了原始模型!这是因为压缩本身起到了类似正则化的效果。
3.2 编程能力
| 基准测试 | Qwen3.6 27B | 三值版 | 二值版 |
|---|---|---|---|
| HumanEval+ | 95.12 | 93.90 | 89.02 |
| MBPP+ | 83.33 | 81.22 | 78.63 |
| LiveCodeBench | 87.77 | 82.75 | 78.08 |
编程能力仅下降 2-5 个百分点,对于日常开发辅助完全够用。
3.3 智能密度(Intelligence Density)
PrismML 提出了一个非常有价值的指标 智能密度:
D = -log₂(1 - score/100) / size_GB
| 模型 | 大小 | 平均分 | 智能密度 |
|---|---|---|---|
| 三值 Bonsai 27B | 5.9 GB | 80.49 | 0.400 |
| 1-bit Bonsai 27B | 3.9 GB | 76.11 | 0.530 |
| Qwen3.6-27B IQ2_XXS | 9.4 GB | 72.73 | 0.199 |
| Gemma-4-31B Q2_K_XL | 11.8 GB | 73.31 | 0.162 |
| Qwen3.6-27B Q4_K_XL | 17.6 GB | 84.99 | 0.155 |
| Qwen3.6-27B FP16 | 54 GB | 85.07 | 0.051 |
三值 Bonsai 27B 的智能密度是传统 INT4 量化的 2.6 倍,是 FP16 的 8 倍!

四、手把手运行 Bonsai 27B(代码实操)
4.1 环境要求
- GPU(推荐):NVIDIA RTX 3060 及以上 / Apple M4 Pro 及以上
- 内存:8GB+(三值版)/ 6GB+(二值版)
- 操作系统:macOS / Linux / Windows
4.2 安装 llama.cpp(带 Bonsai 支持)
PrismML 提供了一个专门的分支:
# 克隆专用分支
git clone https://github.com/PrismML-Eng/llama.cpp.git
cd llama.cpp
# 编译(macOS Metal 加速)
make clean && LLAMA_METAL=1 make -j
# 编译(Linux CUDA 加速)
make clean && LLAMA_CUDA=1 make -j
4.3 下载模型
从 HuggingFace 下载 GGUF 文件:
# 安装 huggingface-cli
pip install huggingface-hub
# 下载三值版(~7.2 GB)
huggingface-cli download prism-ml/Ternary-Bonsai-27B-gguf \
ternary-bonsai-27b-q2_0_g128.gguf \
--local-dir ./models/bonsai
# 或下载二值版(~4.5 GB,适合手机)
huggingface-cli download prism-ml/Bonsai-27B-gguf \
bonsai-27b-q1_0_g64.gguf \
--local-dir ./models/bonsai
4.4 运行推理
# 基本对话模式
./llama-cli \
-m ./models/bonsai/ternary-bonsai-27b-q2_0_g128.gguf \
-p "请用 Python 实现一个快速排序算法,并附带时间复杂度分析" \
-n 1024 \
-t 8
# 交互模式(类似 ChatGPT)
./llama-cli \
-m ./models/bonsai/ternary-bonsai-27b-q2_0_g128.gguf \
--interactive \
--chat-template chatml \
-t 8 \
-c 8192
4.5 使用 Python 调用
# 使用 llama-cpp-python 调用
from llama_cpp import Llama
# 加载三值版 Bonsai 27B
llm = Llama(
model_path="./models/bonsai/ternary-bonsai-27b-q2_0_g128.gguf",
n_ctx=8192, # 上下文长度
n_threads=8, # CPU 线程数
n_gpu_layers=-1, # 全部 GPU 加速
verbose=False
)
# 流式调用
response = llm.create_chat_completion(
messages=[
{"role": "system", "content": "你是一个资深 Python 技术专家。"},
{"role": "user", "content": "帮我写一个异步 API 服务框架。"}
],
stream=True,
max_tokens=2048,
temperature=0.7
)
for chunk in response:
delta = chunk["choices"][0]["delta"]
if "content" in delta:
print(delta["content"], end="", flush=True)
4.6 性能实测数据
| 硬件平台 | 加载精度 | 推理速度 | 峰值内存 |
|---|---|---|---|
| Apple M5 Pro (48GB) | 三值版 | ~26 tok/s | ~8.5 GB |
| Apple M4 Pro (24GB) | 三值版 | ~18 tok/s | ~8.2 GB |
| iPhone 17 Pro | 二值版 | ~11 tok/s | ~4.2 GB |
| RTX 4090 (24GB) | 三值版 | ~45 tok/s | ~7.5 GB |
| RTX 3060 (12GB) | 三值版 | ~22 tok/s | ~7.2 GB |
注意:以上数据来自 PrismML 官方测试及社区反馈,实际表现因系统负载而异。
五、实际应用场景
5.1 本地 AI 编程助手
在普通笔记本上部署 Bonsai 27B 后,配合 VS Code 的 Continue 插件或本地 Agent 框架,即可获得不输 GitHub Copilot 的编程体验,且数据完全本地化。
# 启动一个本地 API 服务
./llama-server \
-m ./models/bonsai/ternary-bonsai-27b-q2_0_g128.gguf \
--host 0.0.0.0 \
--port 8080 \
-t 8 \
-ngl 99
# 访问 http://localhost:8080 即可使用 OpenAI 兼容 API
5.2 离线 Agent 系统
由于模型可以完全在本地运行,你可以构建一个永不联网的 Agent 系统:
- 💼 私密文档分析:不需要把公司数据传到云端
- 🏠 家庭自动化:在树莓派级别设备上运行
- 🔒 安全敏感场景:金融、医疗、法律等
5.3 移动端应用
iOS 应用 Locally AI 已率先集成 Bonsai 27B,在 iPhone 17 Pro 上实现了:
- 📱 完全离线运行
- 🤖 支持视觉问答(拍照识别)
- 📝 262K token 超长上下文(可分析整本小说)
- 🔧 工具调用(Tool Calling)与 MCP 集成

六、技术原理深度解读
6.1 为什么三值量化能保留 95% 性能?
传统量化(如 INT4)是"均匀压缩"——把连续的浮点数空间映射到离散的整数空间,丢失了权重之间的相对关系。
而三值量化的核心洞察是:对于大多数 LLM 权重,真正重要的不是具体数值,而是权重的符号和幅度级别。
传统 FP16: [0.1234, -0.5678, 0.0012, -0.0009, 2.3456]
三值量化: [+1, -1, 0, 0, +1 ]
群缩放因子: scale = 2.3456 (每128个权重共享)
每个权重丢失了精确值,但保留了三个最关键的信息:
- 正负方向(+1 或 -1)
- 是否激活(0 表示接近零的弱连接)
- 整体幅度(分组缩放因子)
这实际上是一种高度优化的信息压缩,而不是简单的精度损失。
6.2 混合注意力机制
Bonsai 27B 继承了 Qwen3.6 的 Hybrid Attention 架构:
- 75% 线性注意力层(Linear Attention):O(n) 复杂度,支持超长上下文
- 25% 全局注意力层(Full Attention):O(n²) 复杂度,保证关键推理质量
这种设计使得模型能够在 262K token 的超长上下文下仍保持高效推理。
6.3 推测解码加速
Bonsai 27B 还提供了一个 DSpark 草稿模型(约 1.95 GB),用于推测解码(Speculative Decoding):
- 草稿模型快速生成候选 token
- 主模型并行验证
- 在 M5 Pro 上实现约 26 tok/s 的推理速度
七、与竞品对比
| 特性 | Bonsai 27B 三值版 | Gemma 4 12B Q4 | Qwen3.6 27B Q4 | DeepSeek-V3 |
|---|---|---|---|---|
| 参数规模 | 27B | 12B | 27B | 671B |
| 部署大小 | ~7.2 GB | ~7 GB | ~17.6 GB | 云端 |
| 上下文长度 | 262K | 32K | 128K | 128K |
| 智能密度 | 0.400 | — | 0.155 | — |
| 可运行设备 | 笔记本/手机 | 笔记本 | 高端显卡 | 仅云端 |
| 多模态 | ✅ 视觉 | ✅ 视觉 | ✅ 视觉 | ✅ |
| 许可证 | Apache 2.0 | 受限 | Apache 2.0 | 受限 |
结论:在 7GB 这个量级的模型文件中,Bonsai 27B 的智能水平是无敌的。
八、未来展望
Bonsai 27B 的发布标志着 "大模型上手机"时代 正式开启:
- 端侧推理将成为标配:未来旗舰手机将原生支持 27B 级模型推理
- 隐私计算的新范式:用户数据无需离开设备即可获得顶级 AI 服务
- 离线 AI Agent 的爆发:从智能家居到车载系统,AI 将无处不在
PrismML 团队表示,下一代 Bonsai 将在 3GB 以内实现 30B+ 参数级别的性能——届时,智能手表都能跑大模型了。
九、总结
| 关键点 | 说明 |
|---|---|
| 🔥 最新 | 2026年7月14日发布,仅4天前 |
| 📦 超小 | 三值版 5.9GB,二值版 3.9GB |
| 🧠 高智 | 保留 FP16 的 90%-95% 性能 |
| 📱 上手机 | iPhone 17 Pro 11 tok/s 流畅运行 |
| 🆓 开源 | Apache 2.0 许可证 |
| 🛠 实测 | 支持 llama.cpp、Python、Ollama |
直接上手:下载 GGUF → 启动 llama.cpp → 本地体验 27B 级大模型。
本文代码示例基于 Bonsai 27B 官方文档编写,测试环境为 macOS Sequoia + Apple M5 Pro。
参考资料:
更多推荐
所有评论(0)