BugTraceAI深度评测:本地网络安全大模型巅峰之作,在线模型生成Payload老提示被拒绝?试试它吧,它不懂拒绝。
BugTraceAI深度评测:本地网络安全大模型巅峰之作,在线模型生成Payload老提示被拒绝?试试它吧,它不懂拒绝。
实测数据 + 独立基准 ,一篇看懂这个漏洞分析模型

1、 开篇:什么是 BugTraceAI-CORE-Ultra-27B-Q4?
2025 年 8 月,HuggingFace 上出现了一个名字很长、来头不小的模型——BugTraceAI-CORE-Ultra-27B-Q4。它标榜自己是“为漏洞赏金和 CVE 分析量身定制”的 27B 参数大模型,基于 Qwen3.6-27B-Heretic2-Uncensored 微调而成。
一句话总结:这是一个用 2541 份漏洞赏金报告和 CVE 文档 SFT 训练出来的“安全专家”,量化为 Q4_K_S(15GB),16-20GB 显存就能跑。
先说重点信息:
• 基底模型:Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking(通过 abliteration 技术去审查,KLD 0.0469)
• 训练方式:SFT via Unsloth,LoRA rank 16,2 个 epoch
• 训练数据:2541 份漏洞赏金报告 + CVE 文档
• 硬件环境:RunPod H100 80GB
• 量化格式:IMatrix-guided Q4_K_S(15GB)和 Q6_K(21GB)
• HuggingFace 点赞:92 个↑(截至发稿)
2 、核心理念:Tooling Model vs Reasoning Model
作者把 BugTraceAI 生态分为两类模型,这是理解 Ultra 定位的关键:
|
类型 |
代表模型 |
定位 |
使用场景 |
|
Tooling Model |
CORE Ultra Q4/Q6 (27B) |
生成工件、写 PoC、生成扫描脚本 |
需要精准输出可执行代码和工件 |
|
Reasoning Model |
Apex (26B MoE) |
深度分析、挖掘逻辑、思考安全问题 |
需要推理和判断 |
“Ultra 是手,Apex 是脑。你不会让手去思考战略,也不会让脑去写代码”——作者原话
3、 完整生态拒览(留言想看哪个模型,下期更新)
|
模型名称 |
参数 |
类型 |
显存需求 |
定位 |
|
CORE Fast |
7B |
Dense |
8GB |
快速响应、初筛 |
|
CORE Pro |
12B |
Dense |
12GB |
中级分析 |
|
CORE Ultra Q4 |
27B |
Dense Q4 |
16-20GB |
工件生成、PoC |
|
CORE Ultra Q6 |
27B |
Dense Q6 |
22-24GB |
高精度工件 |
|
Apex |
26B |
MoE |
24GB+ |
深度推理分析 |
4、 实测成绩:数据会说话
以下所有测试数据均来自官方发布和独立第三方测试,非编造。
4.1 官方 Ultra Bench v1.0 测试
作者发布的官方基准测试,包含 5 个场景:漏洞识别、PoC 生成、修复建议、避免检测、安全架构评估。
|
测试项 |
结果 |
备注 |
|
场景1:漏洞识别 |
通过 |
准确识别 SQL 注入 |
|
场景2:PoC 生成 |
通过 |
可执行的 exploit 代码 |
|
场景3:修复建议 |
通过 |
给出具体修复方案 |
|
场景4:避免检测 |
通过 |
正确检测 WAF 绕过 |
|
场景5:安全架构 |
通过 |
合理的架构建议 |
|
总计 |
5/5 通过 |
拒绝率 0% |
官方声称拒绝率 0%,也就是说对所有测试场景都给出了回复,没有“我不能帮你”的回复。这主要归功于其 Uncensored 基底模型。
4.2 独立基准:zephel01 测试
独立测试人 zephel01 在 besthub.dev 上发布了详细的基准测试,覆盖三个维度:
|
测试维度 |
题目数 |
通过 |
通过率 |
|
漏洞识别与分类 |
40 |
40 |
100% |
|
PoC 生成与利用 |
60 |
58 |
96.7% |
|
安全架构师 |
20 |
18 |
90% |
|
总计 |
120 |
116 |
96.7% |
亮点:
• 漏洞识别准确率 100%,40 题全对,包括 OWASP Top 10 和边缘型漏洞
• PoC 生成 58/60,2 个失败项是复杂的内存管理类漏洞
• 架构师测试 18/20,表现优于同体量其他模型
zephel01 原话:“在漏洞识别和 PoC 生成方面,Ultra Q4 的表现确实令人印象深刻,尤其是考虑到它只是个 Q4 量化版本。但在复杂推理任务上仍有局限。”
4.3 与基底模型对比
作者对比了 Ultra Q4 与其基底模型 Qwen3.6-27B-Heretic2 在安全任务上的表现:
|
指标 |
Qwen3.6-27B-Heretic2 (基底) |
Ultra Q4 (微调后) |
提升 |
|
安全任务准确率 |
96.7% |
98.3% |
+1.6% |
|
拒绝回复率 |
12% |
0% |
-12% |
|
PoC 可执行率 |
78% |
92% |
+14% |
|
CVE 分析覆盖 |
60% |
85% |
+25% |
关键发现:微调带来的最大提升不是准确率(+1.6%),而是 PoC 可执行率(+14%)和拒绝率(从 12% 降到 0%)。这说明 SFT 训练主要解决了“不拒绝”和“输出可用”两个痛点。
4.4 社区评价
模型发布后在社区引发了不小的讨论,数据如下:
|
平台 |
数据 |
|
HuggingFace 点赞 |
92 ↑ |
|
HuggingFace 下载 |
3,200+ |
|
LinkedIn 关注 |
1600+ 点赞 |
|
LinkedIn 浏览 |
100,000+ 次 |
|
讨论区评论 |
200+ |
争议焦点:
支持方观点:
• 填补了开源安全 AI 的空白,Q4 版本对消费者友好
• 拒绝率 0% 在安全场景很重要,不用再和“我不能帮你”斗智斗勇
• PoC 可执行率 92% ,实战可用性高
质疑方观点:
• LinkedIn 上 Radoslav Krehlik 等安全从业者质疑其“去审查”的安全性和伦理问题
• 2541 份训练数据集偏小,可能过拟合
• 官方 Bench 测试只有 5 个场景,样本量太少
• 基底模型本身已表现不错(96.7%),微调增益有限
“如果基底模型已经能做到 96.7%,那 SFT 训练带来的 1.6% 提升是否值得取消安全担忧?”——Radoslav Krehlik, LinkedIn
5 部署指南
使用 llama.cpp 本地部署:
git clone https://github.com/ggerganov/llama.cpp cd llama.cpp && mkdir build && cd build cmake .. -DGGML_CUDA=ON make -j # 下载模型 huggingface-cli download BugTraceAI/BugTraceAI-CORE-Ultra-27B-Q4 # 启动服务 ./llama-server \ -m BugTraceAI-CORE-Ultra-27B-Q4.gguf \ --n-gpu-layers 35 \ --ctx-size 8192 \ --port 8080
使用 Ollama(更简单):
ollama run bugtraceai/ultra-27b-q4
BugTraceAI-CORE-Ultra-27B-Q4 是一个有明确定位的工具型模型——它不是来解决万能问题的,而是专注于“漏洞识别 + PoC 生成”这一个垂直场景。
从测试数据看,它在其目标场景下表现确实不错:拒绝率 0%、PoC 可执行率 92%、漏洞识别 100%。但训练数据集偏小、官方测试样本不足、去审查的伦理争议也是实实在在的问题。
最终评价:作为一个本地可跑、不拒绝、PoC 质量高的安全助手,Ultra Q4 非常值得一试!
评论区留言想看这个模型测试哪些问题,下期可单独出一篇实际应用测试。
🔒 关注我,持续分享智能化硬核干货。觉得有用的话,点赞 + 在看 + 转发三连支持一下~
更多推荐
所有评论(0)