BugTraceAI深度评测:本地网络安全大模型巅峰之作,在线模型生成Payload老提示被拒绝试试它吧,它不懂拒绝。

实测数据 + 独立基准 ,一篇看懂这个漏洞分析模型

1、 开篇:什么是 BugTraceAI-CORE-Ultra-27B-Q4?

2025 年 8 月,HuggingFace 上出现了一个名字很长、来头不小的模型——BugTraceAI-CORE-Ultra-27B-Q4。它标榜自己是“为漏洞赏金和 CVE 分析量身定制”的 27B 参数大模型,基于 Qwen3.6-27B-Heretic2-Uncensored 微调而成。

一句话总结:这是一个用 2541 份漏洞赏金报告和 CVE 文档 SFT 训练出来的“安全专家”,量化为 Q4_K_S(15GB),16-20GB 显存就能跑。

先说重点信息:

• 基底模型:Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking(通过 abliteration 技术去审查,KLD 0.0469)

• 训练方式:SFT via Unsloth,LoRA rank 16,2 个 epoch

• 训练数据:2541 份漏洞赏金报告 + CVE 文档

• 硬件环境:RunPod H100 80GB

• 量化格式:IMatrix-guided Q4_K_S(15GB)和 Q6_K(21GB)

• HuggingFace 点赞:92 个↑(截至发稿)

2 、核心理念:Tooling Model vs Reasoning Model

作者把 BugTraceAI 生态分为两类模型,这是理解 Ultra 定位的关键:

类型

代表模型

定位

使用场景

Tooling Model

CORE Ultra Q4/Q6 (27B)

生成工件、写 PoC、生成扫描脚本

需要精准输出可执行代码和工件

Reasoning Model

Apex (26B MoE)

深度分析、挖掘逻辑、思考安全问题

需要推理和判断

“Ultra 是手,Apex 是脑。你不会让手去思考战略,也不会让脑去写代码”——作者原话

3、 完整生态拒览留言想看哪个模型,下期更新

模型名称

参数

类型

显存需求

定位

CORE Fast

7B

Dense

8GB

快速响应、初筛

CORE Pro

12B

Dense

12GB

中级分析

CORE Ultra Q4

27B

Dense Q4

16-20GB

工件生成、PoC

CORE Ultra Q6

27B

Dense Q6

22-24GB

高精度工件

Apex

26B

MoE

24GB+

深度推理分析

4、 实测成绩:数据会说话

以下所有测试数据均来自官方发布和独立第三方测试,非编造。

4.1 官方 Ultra Bench v1.0 测试

作者发布的官方基准测试,包含 5 个场景:漏洞识别、PoC 生成、修复建议、避免检测、安全架构评估。

测试项

结果

备注

场景1:漏洞识别

通过

准确识别 SQL 注入

场景2:PoC 生成

通过

可执行的 exploit 代码

场景3:修复建议

通过

给出具体修复方案

场景4:避免检测

通过

正确检测 WAF 绕过

场景5:安全架构

通过

合理的架构建议

总计

5/5 通过

拒绝率 0%

官方声称拒绝率 0%,也就是说对所有测试场景都给出了回复,没有“我不能帮你”的回复。这主要归功于其 Uncensored 基底模型。

4.2 独立基准:zephel01 测试

独立测试人 zephel01 在 besthub.dev 上发布了详细的基准测试,覆盖三个维度:

测试维度

题目数

通过

通过率

漏洞识别与分类

40

40

100%

PoC 生成与利用

60

58

96.7%

安全架构师

20

18

90%

总计

120

116

96.7%

亮点:

• 漏洞识别准确率 100%,40 题全对,包括 OWASP Top 10 和边缘型漏洞

• PoC 生成 58/60,2 个失败项是复杂的内存管理类漏洞

• 架构师测试 18/20,表现优于同体量其他模型

zephel01 原话:“在漏洞识别和 PoC 生成方面,Ultra Q4 的表现确实令人印象深刻,尤其是考虑到它只是个 Q4 量化版本。但在复杂推理任务上仍有局限。”

4.3 与基底模型对比

作者对比了 Ultra Q4 与其基底模型 Qwen3.6-27B-Heretic2 在安全任务上的表现:

指标

Qwen3.6-27B-Heretic2 (基底)

Ultra Q4 (微调后)

提升

安全任务准确率

96.7%

98.3%

+1.6%

拒绝回复率

12%

0%

-12%

PoC 可执行率

78%

92%

+14%

CVE 分析覆盖

60%

85%

+25%

关键发现:微调带来的最大提升不是准确率(+1.6%),而是 PoC 可执行率(+14%)和拒绝率(从 12% 降到 0%)。这说明 SFT 训练主要解决了“不拒绝”和“输出可用”两个痛点。

4.4 社区评价

模型发布后在社区引发了不小的讨论,数据如下:

平台

数据

HuggingFace 点赞

92 ↑

HuggingFace 下载

3,200+

LinkedIn 关注

1600+ 点赞

LinkedIn 浏览

100,000+ 次

讨论区评论

200+

争议焦点:

支持方观点:

• 填补了开源安全 AI 的空白,Q4 版本对消费者友好

• 拒绝率 0% 在安全场景很重要,不用再和“我不能帮你”斗智斗勇

• PoC 可执行率 92% ,实战可用性高

质疑方观点:

• LinkedIn 上 Radoslav Krehlik 等安全从业者质疑其“去审查”的安全性和伦理问题

• 2541 份训练数据集偏小,可能过拟合

• 官方 Bench 测试只有 5 个场景,样本量太少

• 基底模型本身已表现不错(96.7%),微调增益有限

“如果基底模型已经能做到 96.7%,那 SFT 训练带来的 1.6% 提升是否值得取消安全担忧?”——Radoslav Krehlik, LinkedIn

5 部署指南

使用 llama.cpp 本地部署:

git clone https://github.com/ggerganov/llama.cpp          cd llama.cpp && mkdir build && cd build          cmake .. -DGGML_CUDA=ON          make -j          # 下载模型          huggingface-cli download BugTraceAI/BugTraceAI-CORE-Ultra-27B-Q4          # 启动服务          ./llama-server \            -m BugTraceAI-CORE-Ultra-27B-Q4.gguf \            --n-gpu-layers 35 \            --ctx-size 8192 \            --port 8080

使用 Ollama(更简单):

ollama run bugtraceai/ultra-27b-q4

BugTraceAI-CORE-Ultra-27B-Q4 是一个有明确定位的工具型模型——它不是来解决万能问题的,而是专注于“漏洞识别 + PoC 生成”这一个垂直场景。

从测试数据看,它在其目标场景下表现确实不错:拒绝率 0%、PoC 可执行率 92%、漏洞识别 100%。但训练数据集偏小、官方测试样本不足、去审查的伦理争议也是实实在在的问题。

最终评价:作为一个本地可跑、不拒绝、PoC 质量高的安全助手,Ultra Q4 非常值得一试

评论区留言想看这个模型测试哪些问题,下期可单独出一篇实际应用测试。

🔒 关注我,持续分享智能化硬核干货觉得有用的话,点赞 + 在看 + 转发三连支持一下~

更多推荐