AI代码审查已经成了很多团队的标配。但Claude和GPT在审查任务上的表现到底有哪些差异?我们设计了200个代码审查测试用例——100个安全类(SQL注入30+ XSS 25+ 认证绕过25+ 敏感信息硬编码20)、100个逻辑类(空指针25+ 并发安全25+ 资源泄漏25+ 边界条件25)。在TokenStar上同时让Claude Opus和GPT-5.4各审一遍。tokenstar.world 是测试平台。

综合检出率对比

漏洞类型

测试用例数

Claude检出

GPT检出

差距

SQL注入

30

29(97%)

27(90%)

+7%

XSS

25

24(96%)

21(84%)

+12%

认证绕过

25

22(88%)

19(76%)

+12%

敏感信息硬编码

20

20(100%)

20(100%)

持平

空指针

25

23(92%)

24(96%)

-4%

并发安全

25

22(88%)

18(72%)

+16%

资源泄漏

25

24(96%)

21(84%)

+12%

边界条件

25

22(88%)

23(92%)

-4%

Claude在安全类漏洞上的检出率整体领先——尤其是XSS(+12%)、认证绕过(+12%)、并发安全(+16%)。这三种漏洞的共同特点是需要理解代码执行流程和潜在攻击面——Claude的深度推理能力在这里发挥作用。GPT在空指针和边界条件这种更偏向"代码规范"类型的检查上略优。

但检出率高不代表完美——误报率也需要看。Claude的整体误报率(标记了但其实不是漏洞)约8%,GPT约5%。Claude更"敏感"——宁可多报也不漏报。这在安全审查中其实是优点(漏报的代价远高于误报),但如果你的团队Review时间紧张,误报率每高3个点就多花一些甄别时间。建议是Claude做安全审查(检出率优先),GPT做代码规范审查(准确率优先)。TokenStar上一个平台同时跑两个模型。

更多推荐