2026 年 7 月 14 日,PrismML 正式发布 Bonsai 27B,基于 Qwen3.6-27B 的 1-bit 二进制 / 1.58-bit 三值量化模型,仅需 3.9GB 即可在 iPhone 17 Pro 上以 11 tok/s 流畅运行,成为首个能在手机上运行的 27B 级大模型!


一、引言:大模型本地部署的"不可能三角"

自从大语言模型(LLM)进入"百模大战"时代以来,开发者始终面临一个"不可能三角":

        模型性能(越大越好)
            /\
           /  \
          /    \
         /______\
  内存占用(越小越好)  推理速度(越快越好)

一个 27B 参数的模型在 FP16 精度下需要 54GB 内存,即使经过 4-bit 量化(如 GGUF Q4_K_M),仍然需要 18GB 左右 的显存 —— 这意味着普通笔记本跑不动、手机更不可能。

直到 Bonsai 27B 的出现。

AI 大脑抽象概念图


二、Bonsai 27B 技术解析:什么是三值量化?

2.1 传统量化 vs 三值量化

传统模型权重使用 FP16(16 位浮点数)存储,每个权重占 16 位。量化就是降低这个精度:

量化方式 每位占位 27B 模型理论大小 可运行设备
FP16(原始) 16 bit ~54 GB 数据中心 GPU
INT4 (Q4_K_M) 4 bit ~18 GB 高端显卡(24GB+)
INT2 (IQ2_XXS) 2.8 bit ~9.4 GB 部分笔记本
三值 (Ternary) 1.71 bit ~5.9 GB 普通笔记本
二值 (Binary) 1.125 bit ~3.9 GB 手机

Bonsai 27B 的核心创新在于:每个权重不再是 0~65535 之间的浮点数,而是仅取 {-1, 0, +1} 三个值之一。

数学上看,log₂(3) ≈ 1.585 bit,加上每 128 个权重共享一个 FP16 缩放因子,实际有效位宽仅为 1.71 bit/weight —— 比 FP16 缩小 9.4 倍

2.2 两个版本:灵活选择

Bonsai 27B 提供两个版本:

版本 位宽 理论大小 部署大小 性能保留 目标设备
三值版 (Ternary) 1.71 bit 5.9 GB ~7.2 GB 95% 笔记本、桌面
二值版 (1-bit) 1.125 bit 3.9 GB ~4.5 GB 90% 手机、平板

两个版本均采用 端到端低比特架构——从 Embedding、Attention 投影、MLP 投影到 LM Head,所有层都使用低比特表示,没有"高精度逃生舱"。


三、性能表现:压缩 10 倍,智能不缩水

很多开发者会担心:压缩这么狠,模型还"聪明"吗?

我们直接看 15 项基准测试(Thinking Mode)的结果:

3.1 数学与推理

基准测试 Qwen3.6 27B (FP16) 三值版 二值版
GSM8K 95.30 96.06 93.63
MATH-500 99.40 99.20 98.40
AIME25 93.29 90.84 80.53
AIME26 93.33 87.50 80.00

注意:在 GSM8K 上三值版甚至超越了原始模型!这是因为压缩本身起到了类似正则化的效果。

3.2 编程能力

基准测试 Qwen3.6 27B 三值版 二值版
HumanEval+ 95.12 93.90 89.02
MBPP+ 83.33 81.22 78.63
LiveCodeBench 87.77 82.75 78.08

编程能力仅下降 2-5 个百分点,对于日常开发辅助完全够用。

3.3 智能密度(Intelligence Density)

PrismML 提出了一个非常有价值的指标 智能密度

D = -log₂(1 - score/100) / size_GB
模型 大小 平均分 智能密度
三值 Bonsai 27B 5.9 GB 80.49 0.400
1-bit Bonsai 27B 3.9 GB 76.11 0.530
Qwen3.6-27B IQ2_XXS 9.4 GB 72.73 0.199
Gemma-4-31B Q2_K_XL 11.8 GB 73.31 0.162
Qwen3.6-27B Q4_K_XL 17.6 GB 84.99 0.155
Qwen3.6-27B FP16 54 GB 85.07 0.051

三值 Bonsai 27B 的智能密度是传统 INT4 量化的 2.6 倍,是 FP16 的 8 倍

编程开发示意图


四、手把手运行 Bonsai 27B(代码实操)

4.1 环境要求

  • GPU(推荐):NVIDIA RTX 3060 及以上 / Apple M4 Pro 及以上
  • 内存:8GB+(三值版)/ 6GB+(二值版)
  • 操作系统:macOS / Linux / Windows

4.2 安装 llama.cpp(带 Bonsai 支持)

PrismML 提供了一个专门的分支:

# 克隆专用分支
git clone https://github.com/PrismML-Eng/llama.cpp.git
cd llama.cpp

# 编译(macOS Metal 加速)
make clean && LLAMA_METAL=1 make -j

# 编译(Linux CUDA 加速)
make clean && LLAMA_CUDA=1 make -j

4.3 下载模型

从 HuggingFace 下载 GGUF 文件:

# 安装 huggingface-cli
pip install huggingface-hub

# 下载三值版(~7.2 GB)
huggingface-cli download prism-ml/Ternary-Bonsai-27B-gguf \
  ternary-bonsai-27b-q2_0_g128.gguf \
  --local-dir ./models/bonsai

# 或下载二值版(~4.5 GB,适合手机)
huggingface-cli download prism-ml/Bonsai-27B-gguf \
  bonsai-27b-q1_0_g64.gguf \
  --local-dir ./models/bonsai

4.4 运行推理

# 基本对话模式
./llama-cli \
  -m ./models/bonsai/ternary-bonsai-27b-q2_0_g128.gguf \
  -p "请用 Python 实现一个快速排序算法,并附带时间复杂度分析" \
  -n 1024 \
  -t 8

# 交互模式(类似 ChatGPT)
./llama-cli \
  -m ./models/bonsai/ternary-bonsai-27b-q2_0_g128.gguf \
  --interactive \
  --chat-template chatml \
  -t 8 \
  -c 8192

4.5 使用 Python 调用

# 使用 llama-cpp-python 调用
from llama_cpp import Llama

# 加载三值版 Bonsai 27B
llm = Llama(
    model_path="./models/bonsai/ternary-bonsai-27b-q2_0_g128.gguf",
    n_ctx=8192,      # 上下文长度
    n_threads=8,      # CPU 线程数
    n_gpu_layers=-1,  # 全部 GPU 加速
    verbose=False
)

# 流式调用
response = llm.create_chat_completion(
    messages=[
        {"role": "system", "content": "你是一个资深 Python 技术专家。"},
        {"role": "user", "content": "帮我写一个异步 API 服务框架。"}
    ],
    stream=True,
    max_tokens=2048,
    temperature=0.7
)

for chunk in response:
    delta = chunk["choices"][0]["delta"]
    if "content" in delta:
        print(delta["content"], end="", flush=True)

4.6 性能实测数据

硬件平台 加载精度 推理速度 峰值内存
Apple M5 Pro (48GB) 三值版 ~26 tok/s ~8.5 GB
Apple M4 Pro (24GB) 三值版 ~18 tok/s ~8.2 GB
iPhone 17 Pro 二值版 ~11 tok/s ~4.2 GB
RTX 4090 (24GB) 三值版 ~45 tok/s ~7.5 GB
RTX 3060 (12GB) 三值版 ~22 tok/s ~7.2 GB

注意:以上数据来自 PrismML 官方测试及社区反馈,实际表现因系统负载而异。


五、实际应用场景

5.1 本地 AI 编程助手

在普通笔记本上部署 Bonsai 27B 后,配合 VS Code 的 Continue 插件或本地 Agent 框架,即可获得不输 GitHub Copilot 的编程体验,且数据完全本地化

# 启动一个本地 API 服务
./llama-server \
  -m ./models/bonsai/ternary-bonsai-27b-q2_0_g128.gguf \
  --host 0.0.0.0 \
  --port 8080 \
  -t 8 \
  -ngl 99

# 访问 http://localhost:8080 即可使用 OpenAI 兼容 API

5.2 离线 Agent 系统

由于模型可以完全在本地运行,你可以构建一个永不联网的 Agent 系统

  • 💼 私密文档分析:不需要把公司数据传到云端
  • 🏠 家庭自动化:在树莓派级别设备上运行
  • 🔒 安全敏感场景:金融、医疗、法律等

5.3 移动端应用

iOS 应用 Locally AI 已率先集成 Bonsai 27B,在 iPhone 17 Pro 上实现了:

  • 📱 完全离线运行
  • 🤖 支持视觉问答(拍照识别)
  • 📝 262K token 超长上下文(可分析整本小说)
  • 🔧 工具调用(Tool Calling)与 MCP 集成

手机边缘设备示意图


六、技术原理深度解读

6.1 为什么三值量化能保留 95% 性能?

传统量化(如 INT4)是"均匀压缩"——把连续的浮点数空间映射到离散的整数空间,丢失了权重之间的相对关系

而三值量化的核心洞察是:对于大多数 LLM 权重,真正重要的不是具体数值,而是权重的符号和幅度级别

传统 FP16:  [0.1234, -0.5678, 0.0012, -0.0009, 2.3456]
三值量化:   [+1,     -1,      0,       0,       +1    ]
群缩放因子: scale = 2.3456  (每128个权重共享)

每个权重丢失了精确值,但保留了三个最关键的信息:

  1. 正负方向(+1 或 -1)
  2. 是否激活(0 表示接近零的弱连接)
  3. 整体幅度(分组缩放因子)

这实际上是一种高度优化的信息压缩,而不是简单的精度损失。

6.2 混合注意力机制

Bonsai 27B 继承了 Qwen3.6 的 Hybrid Attention 架构:

  • 75% 线性注意力层(Linear Attention):O(n) 复杂度,支持超长上下文
  • 25% 全局注意力层(Full Attention):O(n²) 复杂度,保证关键推理质量

这种设计使得模型能够在 262K token 的超长上下文下仍保持高效推理。

6.3 推测解码加速

Bonsai 27B 还提供了一个 DSpark 草稿模型(约 1.95 GB),用于推测解码(Speculative Decoding):

  • 草稿模型快速生成候选 token
  • 主模型并行验证
  • 在 M5 Pro 上实现约 26 tok/s 的推理速度

七、与竞品对比

特性 Bonsai 27B 三值版 Gemma 4 12B Q4 Qwen3.6 27B Q4 DeepSeek-V3
参数规模 27B 12B 27B 671B
部署大小 ~7.2 GB ~7 GB ~17.6 GB 云端
上下文长度 262K 32K 128K 128K
智能密度 0.400 0.155
可运行设备 笔记本/手机 笔记本 高端显卡 仅云端
多模态 ✅ 视觉 ✅ 视觉 ✅ 视觉
许可证 Apache 2.0 受限 Apache 2.0 受限

结论:在 7GB 这个量级的模型文件中,Bonsai 27B 的智能水平是无敌的。


八、未来展望

Bonsai 27B 的发布标志着 "大模型上手机"时代 正式开启:

  1. 端侧推理将成为标配:未来旗舰手机将原生支持 27B 级模型推理
  2. 隐私计算的新范式:用户数据无需离开设备即可获得顶级 AI 服务
  3. 离线 AI Agent 的爆发:从智能家居到车载系统,AI 将无处不在

PrismML 团队表示,下一代 Bonsai 将在 3GB 以内实现 30B+ 参数级别的性能——届时,智能手表都能跑大模型了。


九、总结

关键点 说明
🔥 最新 2026年7月14日发布,仅4天前
📦 超小 三值版 5.9GB,二值版 3.9GB
🧠 高智 保留 FP16 的 90%-95% 性能
📱 上手机 iPhone 17 Pro 11 tok/s 流畅运行
🆓 开源 Apache 2.0 许可证
🛠 实测 支持 llama.cpp、Python、Ollama

直接上手:下载 GGUF → 启动 llama.cpp → 本地体验 27B 级大模型。


本文代码示例基于 Bonsai 27B 官方文档编写,测试环境为 macOS Sequoia + Apple M5 Pro。

参考资料:

更多推荐