当整个AI行业都在用千亿、万亿参数堆砌“无所不能”的超级模型时,有一个模型选择了一条截然不同的路——它问了一个看似简单却极其硬核的问题:如果只激活8B参数,能不能在编程Agent任务上吊打参数规模4-25倍的更大模型?

模型地址:https://www.modelscope.cn/models/poolside/Laguna-S-2.1


一、为什么这个模型值得你停下来读?

如果你接触过AI编程(AI Coding) ,你一定对这样的困境习以为常:想要好的Agent编程能力?得上Kimi K3、DeepSeek-V4这类千亿甚至万亿参数的巨无霸。但大模型推理成本高、延迟大,Agent编程往往需要调用模型数十次甚至上百次完成一个任务——成本直接爆炸。

Laguna S 2.1给出了一个颠覆性的答案:

用118B总参数、每次仅激活8B参数的MoE架构,在Terminal-Bench 2.1、SWE-Bench Multilingual、SWE-Bench Pro等编程Agent评测上,与参数规模4-25倍的更大模型正面硬刚,甚至反超

更绝的是,Poolside团队从立项到发布仅用了52天——这种迭代速度在AI行业堪称恐怖。而且模型权重以OpenMDW-1.1许可证开放,可自由用于商业及非商业用途

这不是在现有模型上做点微调——它是从架构到训练到部署,重新定义了“编程Agent模型的能力上限”


二、核心亮点:四大杀手锏

2.1 ★ MoE架构:118B总参数,每次只激活8B

Laguna S 2.1最核心的设计是混合专家(MoE)架构

  • 总参数量118B
  • 每次激活参数仅8B
  • 专家数量256个路由专家(top-10)+ 1个共享专家
  • 门控机制:基于softplus的token-choice路由器

效果:拥有118B模型的“知识储备”,却只有8B模型的推理成本。这就是MoE的魔力——参数多但不贵,能力强但不慢

2.2 ★ 1M上下文 + 混合注意力:长周期编程的杀手锏

Laguna S 2.1支持1,048,576个token的上下文窗口——相当于可以一次性读完一整部《三体》三部曲还要多。对于需要理解大型代码库、跨文件重构的Agent编程任务,这是刚需。

架构上采用了48层的精心设计:

  • 12层全局注意力 + 36层滑动窗口注意力(窗口大小512)
  • 分组查询注意力(GQA) :8个KV头,头维度128
  • softplus注意力门控 + 按层类型的RoPE缩放

这种1:3的全局/SWA混合布局,既保证了长距离依赖的捕捉能力,又大幅降低了计算复杂度。

2.3 ★ 原生推理支持:interleaved thinking + 推测解码

Laguna S 2.1原生支持交错式思考(interleaved thinking) ——模型可以在工具调用之间进行推理,而不是“黑箱输出”。这对于需要多步推理的编程Agent任务至关重要。

更让人惊喜的是,Poolside还提供了DFlash草稿模型用于推测解码(Speculative Decoding) ——推理速度直接翻倍,质量几乎无损

2.4 ★ 开源 + 量化全家桶:从DGX Spark到MacBook都能跑

Laguna S 2.1的开源程度令人叹为观止:

版本 格式 适用场景
BF16(原版) Safetensors 最高精度,云端部署
FP8 量化 精度几乎无损,速度更快
NVFP4 量化 4-bit,显存占用极小
INT4 量化 极致压缩
GGUF llama.cpp 本地CPU/GPU部署

最震撼的是:Laguna S 2.1可以在单台NVIDIA DGX Spark上运行——一台桌面级设备就能跑118B模型的推理!

GGUF量化版本的文件大小:

  • Q4_K_M:仅75GB
  • Q8_0:128GB
  • F16:235GB(全精度)

社区已经开始在Apple Silicon Mac上通过MLX运行Laguna S 2.1的量化版本——你的笔记本电脑可能也能跑


三、性能表现:拳打Kimi,脚踢DeepSeek

Laguna S 2.1在6个编程Agent基准测试上全面出击:

基准测试 Laguna S 2.1 (118B-A8B) DeepSeek-V4-Pro-Max (1.6T-A49B) Kimi K3 (2.8T-A50B) Qwen 3.7 Max Tencent Hy3 (295B-A21B)
Terminal-Bench 2.1 70.2% 64.0% 88.3% 74.5% 71.7%
SWE-Bench Multilingual 78.5% 76.2% 78.3% 75.8%
SWE-Bench Pro 59.4% 55.4% 60.6% 57.9%
DeepSWE 40.4% 9.0% 69.0%
SWE Atlas (Codebase QnA) 46.2% 27.2%
Toolathlon Verified 49.7% 55.9%

数据来源:

关键发现

  • SWE-Bench Multilingual:78.5分,击败DeepSeek-V4-Pro-Max(76.2)和Tencent Hy3(75.8),与Qwen 3.7 Max(78.3)持平
  • SWE-Bench Pro:59.4分,击败DeepSeek-V4-Pro-Max(55.4)和Tencent Hy3(57.9)
  • DeepSWE:40.4分,是DeepSeek-V4-Pro-Max(9.0)的4.5倍
  • SWE Atlas:46.2分,几乎是DeepSeek-V4-Pro-Max(27.2)的两倍

Poolside官方自信地宣称:Laguna S 2.1是“在其权重类别中遥遥领先的最强Agent编程模型”。


四、快速上手

4.1 模型下载

# ModelScope 下载
git lfs install
git clone https://www.modelscope.cn/models/poolside/Laguna-S-2.1

# 或 Hugging Face 下载
git clone https://huggingface.co/poolside/Laguna-S-2.1

4.2 GGUF量化版本(llama.cpp部署)

Poolside提供了专门的llama.cpp分支:

# 克隆Poolside的llama.cpp分支
git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build -j

# 启动服务(Q4_K_M量化,256K上下文)
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf --jinja --port 8000

# 启用DFlash推测解码(推理加速)
./build/bin/llama-server -m laguna-s-2.1-Q4_K_M.gguf \
  -md laguna-s-2.1-DFlash-BF16.gguf \
  --spec-type draft-dflash --spec-draft-n-max 15 -fa on --jinja --port 8000

注意:GGUF版本默认配置为262,144 token(256K)上下文。如需使用完整的1M上下文,需覆盖RoPE配置:

--ctx-size 1048576 --rope-scaling yarn --rope-scale 128 --yarn-orig-ctx 8192

4.3 Vercel AI Gateway(API调用)

Laguna S 2.1已上线Vercel AI Gateway:

import { streamText } from 'ai';

const result = streamText({
  model: 'poolside/laguna-s-2.1-free', // 免费版:256K上下文
  // model: 'poolside/laguna-s-2.1',   // 付费版:1M上下文
  prompt: 'Fix the flaky test in the payments suite.',
});

4.4 SGLang部署

pip install sglang
# 启动SGLang服务器

参考实现:


五、总结与思考

Laguna S 2.1的价值,远不止于“又出了一个编程模型”。它真正值得深思的地方在于:

第一,它证明了“小激活参数可以做大事情” 。每次只激活8B参数,却在SWE-Bench Multilingual上击败了1.6T参数的DeepSeek-V4-Pro-Max——MoE架构+高质量训练数据,比单纯堆参数更关键

第二,它解决了Agent编程的落地痛点。大模型推理本就昂贵,Agent还要调用数十次——成本翻倍。Laguna S 2.1用8B激活参数达到甚至超越更大模型的效果,直接让Agent编程的推理成本断崖式下降

第三,它的开源程度令人敬佩。从BF16到FP8/NVFP4/INT4/GGUF,从Hugging Face到ModelScope,从llama.cpp到SGLang到Vercel AI Gateway——全栈开源,全平台覆盖。而且OpenMDW-1.1许可证允许商业使用——这对创业公司和独立开发者是巨大的利好。

第四,它展示了“美国开源反击”的战略意义。在中国开源模型(Kimi、DeepSeek、Qwen)主导开源AI生态的当下,Poolside用52天打造了一个能在编程Agent领域正面抗衡的旗舰模型——开源竞赛,远未结束

当然,Laguna S 2.1也有局限:社区测试显示其在SVG/HTML前端任务上尚有提升空间;1M上下文在llama.cpp上可能存在质量退化;完整的118B模型对硬件仍有较高要求。但它打开了一扇门:如果编程Agent的未来不一定是“更大”,而是“更聪明的MoE + 更极致的量化”呢?

模型地址:https://www.modelscope.cn/models/poolside/Laguna-S-2.1

欢迎下载、部署、提issue——一起探索编程Agent的无限可能。

更多推荐