Qwen3.8-27B杀疯了!

阿里Qwen团队开源Qwen3.8-27B,上线2天登顶Hugging Face全球大模型趋势榜,下载破百万(包括FP8),unsloth量化版更是接近3百万下载量。

图片

海外开发者对比实测后,送了个外号,叫“本地Opus4.6”。

人工智能分析指数中,一个不足30B参数的模型,性能超过4个月前发布的所有模型,包括Opus4.6。

图片

图片

性能被评定为与DeepSeek V4-Pro和GPT 5.6 Luna相当。这是首次有本地模型达到顶尖模型的水平。

图片

量化后,塞进17GB内存的电脑就能跑。

它还是原生多模态Dense(稠密)模型,能看图、识视频,262K原生上下文,YaRN外推到1M,Apache 2.0协议放开商用。

编程和Agent,摊开看

SWE-bench Pro真实修代码拿61.7分,Opus4.6 Max为53.4分。

DeepSWE 1.1拿42.2,约是前代13.3的3倍。除了少数几个性能非常接近Opus4.6 Max,其余所有均超越Opus4.6 Max。

完整文本性能表如下:

图片

Agent和办公行同样稳。CoWorkBench长时办公任务70.7分,压过Opus4.6 Max的68.2。

JobBench专业任务33.4分。Agents' Last Exam的Pass@1拿20.4,接近前代10.6的两倍。

指令遵循IFBench 79.5分,竞赛编程LiveCodeBench v6 90.3分,都是全列最高。

一个27B稠密模型,能和一众max版、high版大模型坐同一张桌。

眼睛,原生的

多模态长在架构里。Qwen3.8-27B天生懂图像和视频,上到STEM图表、文档,下到小时级视频,都能直接读。

多模态完整跑分如下:

图片

OSWorld-Verified电脑操作84.3分,高出Opus4.6 Max 11.6分。

AndroidWorld手机操作81.9分。

WebArena-Verified浏览器操作64.8分,比前代高9.5分。

视觉推理项里,不算工具辅助,MathVision 90.0分对65.5分,BabyVision 65.7分对12.6分,CharXiv图表分析83.7分对66.0分,Opus4.6 Max三项全输。

读截图、点按钮、填表格、操作浏览器和手机,配上前面的代码能力,电脑操作Agent的闭环齐了。

家里,跑得动

27B如今是社区最欢迎的尺寸,量化后能装进笔记本,消费级显卡就能跑。

Unsloth量化后,17GB内存的配置就能跑起来。

图片

通过Atomic Dynamic GGUF模型压缩,从8位的28.9GB到1位的8.5GB都有。

图片

SGLang、Ollama、vLLM等当天就跟进。

图片

有开发者惊叹:我们已经生活在一个新的世界。我们的桌子上摆放着无限且免费使用的超级智能设备。

图片

只需要一台RTX 5090显卡,就能拥有相当于Opus 4.8级别的智能水平。

全球开发者都玩疯了,Simon Willison表示已经记不清上次如此愉快地玩一个在自家电脑上运行的本地模型是什么时候了。

图片

模型思考模式默认开,可以按请求关掉,reasoning_effort(推理强度)调深度,preserve_thinking(保留历史思考)留下历史推理。

Simon Willison上手发现,默认reasoning_effort是xhigh,模型想得太多。他的建议先从low或无推理起步。

Qwen3.8-27B把代码和Agent跑分拉到Opus档位,权重、思考深度、数据安全的钥匙一并交给了你。

下载,跑起来,让它干活。

参考资料:

https://huggingface.co/Qwen/Qwen3.8-27B

https://modelscope.cn/models/Qwen/Qwen3.8-27B

https://github.com/AlibabaCloud-Official/Qwen3.8-27B

https://simonw.substack.com/p/qwen-38-27b-is-excellent-but-it-defaults

更多推荐