Laguna S 2.1:118B参数的编程“小钢炮”,单卡DGX Spark就能跑,拳打Kimi脚踢DeepSeek!
当整个AI行业都在用千亿、万亿参数堆砌“无所不能”的超级模型时,有一个模型选择了一条截然不同的路——它问了一个看似简单却极其硬核的问题:如果只激活8B参数,能不能在编程Agent任务上吊打参数规模4-25倍的更大模型?
模型地址:https://www.modelscope.cn/models/poolside/Laguna-S-2.1
一、为什么这个模型值得你停下来读?
如果你接触过AI编程(AI Coding) ,你一定对这样的困境习以为常:想要好的Agent编程能力?得上Kimi K3、DeepSeek-V4这类千亿甚至万亿参数的巨无霸。但大模型推理成本高、延迟大,Agent编程往往需要调用模型数十次甚至上百次完成一个任务——成本直接爆炸。
但Laguna S 2.1给出了一个颠覆性的答案:
用118B总参数、每次仅激活8B参数的MoE架构,在Terminal-Bench 2.1、SWE-Bench Multilingual、SWE-Bench Pro等编程Agent评测上,与参数规模4-25倍的更大模型正面硬刚,甚至反超。
更绝的是,Poolside团队从立项到发布仅用了52天——这种迭代速度在AI行业堪称恐怖。而且模型权重以OpenMDW-1.1许可证开放,可自由用于商业及非商业用途。
这不是在现有模型上做点微调——它是从架构到训练到部署,重新定义了“编程Agent模型的能力上限”。
二、核心亮点:四大杀手锏
2.1 ★ MoE架构:118B总参数,每次只激活8B
Laguna S 2.1最核心的设计是混合专家(MoE)架构:
- 总参数量:118B
- 每次激活参数:仅8B
- 专家数量:256个路由专家(top-10)+ 1个共享专家
- 门控机制:基于softplus的token-choice路由器
效果:拥有118B模型的“知识储备”,却只有8B模型的推理成本。这就是MoE的魔力——参数多但不贵,能力强但不慢。
2.2 ★ 1M上下文 + 混合注意力:长周期编程的杀手锏
Laguna S 2.1支持1,048,576个token的上下文窗口——相当于可以一次性读完一整部《三体》三部曲还要多。对于需要理解大型代码库、跨文件重构的Agent编程任务,这是刚需。
架构上采用了48层的精心设计:
- 12层全局注意力 + 36层滑动窗口注意力(窗口大小512)
- 分组查询注意力(GQA) :8个KV头,头维度128
- softplus注意力门控 + 按层类型的RoPE缩放
这种1:3的全局/SWA混合布局,既保证了长距离依赖的捕捉能力,又大幅降低了计算复杂度。
2.3 ★ 原生推理支持:interleaved thinking + 推测解码
Laguna S 2.1原生支持交错式思考(interleaved thinking) ——模型可以在工具调用之间进行推理,而不是“黑箱输出”。这对于需要多步推理的编程Agent任务至关重要。
更让人惊喜的是,Poolside还提供了DFlash草稿模型用于推测解码(Speculative Decoding) ——推理速度直接翻倍,质量几乎无损。
2.4 ★ 开源 + 量化全家桶:从DGX Spark到MacBook都能跑
Laguna S 2.1的开源程度令人叹为观止:
| 版本 | 格式 | 适用场景 |
|---|---|---|
| BF16(原版) | Safetensors | 最高精度,云端部署 |
| FP8 | 量化 | 精度几乎无损,速度更快 |
| NVFP4 | 量化 | 4-bit,显存占用极小 |
| INT4 | 量化 | 极致压缩 |
| GGUF | llama.cpp | 本地CPU/GPU部署 |
最震撼的是:Laguna S 2.1可以在单台NVIDIA DGX Spark上运行——一台桌面级设备就能跑118B模型的推理!
GGUF量化版本的文件大小:
- Q4_K_M:仅75GB
- Q8_0:128GB
- F16:235GB(全精度)
社区已经开始在Apple Silicon Mac上通过MLX运行Laguna S 2.1的量化版本——你的笔记本电脑可能也能跑。
三、性能表现:拳打Kimi,脚踢DeepSeek
Laguna S 2.1在6个编程Agent基准测试上全面出击:
| 基准测试 | Laguna S 2.1 (118B-A8B) | DeepSeek-V4-Pro-Max (1.6T-A49B) | Kimi K3 (2.8T-A50B) | Qwen 3.7 Max | Tencent Hy3 (295B-A21B) |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 70.2% | 64.0% | 88.3% | 74.5% | 71.7% |
| SWE-Bench Multilingual | 78.5% | 76.2% | — | 78.3% | 75.8% |
| SWE-Bench Pro | 59.4% | 55.4% | — | 60.6% | 57.9% |
| DeepSWE | 40.4% | 9.0% | 69.0% | — | — |
| SWE Atlas (Codebase QnA) | 46.2% | 27.2% | — | — | — |
| Toolathlon Verified | 49.7% | 55.9% | — | — | — |
数据来源:
关键发现:
- SWE-Bench Multilingual:78.5分,击败DeepSeek-V4-Pro-Max(76.2)和Tencent Hy3(75.8),与Qwen 3.7 Max(78.3)持平
- SWE-Bench Pro:59.4分,击败DeepSeek-V4-Pro-Max(55.4)和Tencent Hy3(57.9)
- DeepSWE:40.4分,是DeepSeek-V4-Pro-Max(9.0)的4.5倍
- SWE Atlas:46.2分,几乎是DeepSeek-V4-Pro-Max(27.2)的两倍
Poolside官方自信地宣称:Laguna S 2.1是“在其权重类别中遥遥领先的最强Agent编程模型”。
四、快速上手
4.1 模型下载
# ModelScope 下载
git lfs install
git clone https://www.modelscope.cn/models/poolside/Laguna-S-2.1
# 或 Hugging Face 下载
git clone https://huggingface.co/poolside/Laguna-S-2.1
4.2 GGUF量化版本(llama.cpp部署)
Poolside提供了专门的llama.cpp分支:
# 克隆Poolside的llama.cpp分支
git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build -j
# 启动服务(Q4_K_M量化,256K上下文)
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf --jinja --port 8000
# 启用DFlash推测解码(推理加速)
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf \
-md laguna-s-2.1-DFlash-BF16.gguf \
--spec-type draft-dflash --spec-draft-n-max 15 -fa on --jinja --port 8000
注意:GGUF版本默认配置为262,144 token(256K)上下文。如需使用完整的1M上下文,需覆盖RoPE配置:
--ctx-size 1048576 --rope-scaling yarn --rope-scale 128 --yarn-orig-ctx 8192
4.3 Vercel AI Gateway(API调用)
Laguna S 2.1已上线Vercel AI Gateway:
import { streamText } from 'ai';
const result = streamText({
model: 'poolside/laguna-s-2.1-free', // 免费版:256K上下文
// model: 'poolside/laguna-s-2.1', // 付费版:1M上下文
prompt: 'Fix the flaky test in the payments suite.',
});
4.4 SGLang部署
pip install sglang
# 启动SGLang服务器
参考实现:
五、总结与思考
Laguna S 2.1的价值,远不止于“又出了一个编程模型”。它真正值得深思的地方在于:
第一,它证明了“小激活参数可以做大事情” 。每次只激活8B参数,却在SWE-Bench Multilingual上击败了1.6T参数的DeepSeek-V4-Pro-Max——MoE架构+高质量训练数据,比单纯堆参数更关键。
第二,它解决了Agent编程的落地痛点。大模型推理本就昂贵,Agent还要调用数十次——成本翻倍。Laguna S 2.1用8B激活参数达到甚至超越更大模型的效果,直接让Agent编程的推理成本断崖式下降。
第三,它的开源程度令人敬佩。从BF16到FP8/NVFP4/INT4/GGUF,从Hugging Face到ModelScope,从llama.cpp到SGLang到Vercel AI Gateway——全栈开源,全平台覆盖。而且OpenMDW-1.1许可证允许商业使用——这对创业公司和独立开发者是巨大的利好。
第四,它展示了“美国开源反击”的战略意义。在中国开源模型(Kimi、DeepSeek、Qwen)主导开源AI生态的当下,Poolside用52天打造了一个能在编程Agent领域正面抗衡的旗舰模型——开源竞赛,远未结束。
当然,Laguna S 2.1也有局限:社区测试显示其在SVG/HTML前端任务上尚有提升空间;1M上下文在llama.cpp上可能存在质量退化;完整的118B模型对硬件仍有较高要求。但它打开了一扇门:如果编程Agent的未来不一定是“更大”,而是“更聪明的MoE + 更极致的量化”呢?
模型地址:https://www.modelscope.cn/models/poolside/Laguna-S-2.1
欢迎下载、部署、提issue——一起探索编程Agent的无限可能。
更多推荐

所有评论(0)