在这里插入图片描述
P.S. 挖到宝藏AI教程!全程通俗易懂,风趣幽默,零基础轻松入门, 传送门https://blog.csdn.net/qq_34419312

1 我本来真不想测这模型

1.1 老印象害死人

说出来你们可能不信,Qwen 3.8 Max发布那天,我扫了一眼消息就划走了。

没兴趣,真的。我对Qwen编程能力的刻板印象,少说也存了大半年。就像老家亲戚总觉得你在大城市吃不饱饭——印象焊死了,更新不了。每次有人提Qwen写代码,我心里都默默飘过一句:就这?

久到我都忘了,这印象到底是哪次测出来的。

1.2 免费羊毛不薅白不薅

本来这事就翻篇了,直到我刷到Qoder一周年送免费调用。

800次,还不算登录送的300次,新用户加起来1100次。哦?免费的?那没事了。

程序员的原则是什么?收费的我挑三拣四,免费的我来者不拒。反正不要钱,跑一遍试试也不吃亏。

2 先说清楚,这次怎么比的

2.1 三个前提,免得抬杠

为了公平,我也懒得搞新花样,直接把上次测Kimi K3的三个场景原封不动搬过来。一样的考卷,谁行谁不行,跑一遍就知道。

先说好三个前提,免得后面有人杠我不公平。

第一,这次我把需求一次性说全了,不像上次测K3是挤牙膏似的一轮轮加。相当于Qwen拿到的是完整题干,这点它占了便宜,后面说打平的时候,你们自己心里打个折。

第二,这不是裸模型跑分,是模型加自家IDE的工作流对比。Qwen配Qoder,Kimi配Kimi Code,都是全家桶上阵。说实话现在裸模型分数参考价值越来越小,上班干活谁裸用模型啊?

第三,这次没拿真实老项目测。800次调用刚好用完,手头也没合适的私活要干。真实遗留系统能不能打,这篇说不全。

2.2 三个测试场景

就三个场景,都是实打实能跑的项目,不是嘴炮题。

一个对标剪映的纯前端视频工作台,一个带完整后台的实时选座票务系统,还有一个仿Drive Mad的物理驾驶小游戏。

全程开YOLO模式,我不插手装依赖、改代码、调环境,它自己折腾。交付之后我亲手测所有功能。

3 三个场景跑下来,水平到底咋样

3.1 视频工作台:功能打平,细节超了

第一个场景,视频工作台。素材库、多轨时间轴、片段预览、撤销重做、本地持久化,该有的功能全列清楚了。

跑下来结论:功能层面和K3版打平,该有的一个不少。

但有两点超出预期。

一是界面没那么浓的AI味。深色编辑器配色,信息层级清楚,不像有些AI生成的界面,花里胡哨全是特效,干活的时候晃眼睛。

二是多了不少实用小功能:轨道锁定静音、片段边缘精细修剪、方向键逐帧定位,还有窄屏只读审片模式。都是实际剪辑能用得上的东西,不是花架子。

当然也有别扭的设计。调片段速度的时候,它是片段长度不变,从源素材里夹内容。不像K3是速度变了片段长度跟着变。第一次用得反应两秒,属于设计思路差异,不算bug。

工程质量更没的说,28个单元测试全过,TypeScript类型检查零报错。就这一点,已经比很多刚入职的实习生交的活强了。

3.2 票务系统:真后端,不是玩具Demo

第二个场景是最重的:实时选座票务系统。消费者端选座购票,运营后台管场馆演出,中间锁座、支付、出票、退款、候补、核销一整套状态流转。

我本来以为会给整个前端Demo糊弄事,结果人家直接上了真后端。

PostgreSQL存业务数据,Redis传实时事件,座位状态用SSE推到前端,外加Worker处理锁座过期和候补派位,Docker Compose一键就能拉起来。

我测了支付、退款,刷新页面、换全新浏览器重登,数据全对得上,没出幺蛾子。

细节上甚至比K3版还讲究。锁座是原子操作,一个座不可售整批都失败,不会出现半卖半不卖的尴尬;支付接口带幂等键,手抖点两下也不会生成两笔订单;重复核销直接返回409;候补还有24小时防饿死机制,普通用户等满一天自动升级优先级,不会一直被会员插队。

后台九个模块我全点了一遍,建场馆、上演出、开会员、核销门票,订单、候补、审计日志的数据全能对上,整个过程浏览器控制台零报错。

说真的,这东西套个皮,小商家直接就能用。

3.3 驾驶小游戏:手感赢了,颜值输了

第三个场景,仿Drive Mad的物理驾驶小游戏。只用前进后退控制车辆越障,五个主题关卡,一批即死机制。

上次K3的短板我记得很清楚:关卡长得都差不多,难度偏低,我甚至怀疑它到底用没用正经物理引擎。

这次Qwen直接把短板补上了。

明确用了planck.js,正经Box2D系的物理引擎,不是摆样子。悬挂弹簧、碰撞冲量判定、低重力和冰面摩擦,每关参数都是调过的。

五个关卡主题和上次一样,但机制密度高多了。工地关要推箱子垫路,冰原关有相位旋转杆卡时机,火山关是落石区加连续断桥,步步是坑。

即死机制我挨个试了:托底、被旋转杆扫中、被落石砸中、掉出边界、碰到熔岩,全真实触发,没一个掺水的。难度也真上去了,冰原和火山那两关,我自己玩死了好几次。

它还带了23个测试,全过,甚至包括五个关卡的无头仿真通关脚本,模拟输入自动跑完全程。

当然K3也不是全输。K3版画面色彩更花哨,结算界面也更俏皮。Qwen版走的是朴素实用风,赢在手感和玩法,输在卖相。

4 最让我意外的一点,跑分表里根本看不到

三个场景跑下来,我发现它耗时都比K3长一点。一开始我以为是模型推理慢,翻了下过程记录,根本不是。

它慢,是因为它写完代码,会自己开浏览器做验收。而且验得特别较真,比我司不少测试岗都细。

做视频工作台的时候,它发现后台标签页里预览会因为浏览器rAF节流卡住,自己把播放循环改成了rAF加setInterval双驱动;发现Delete键删片段没生效,自己模拟键盘事件排查出了问题。

做票务系统的时候,它先检查环境,发现Docker没启动自己给拉起来,跑完25个测试,还自己进浏览器把完整支付核销流程走了一遍。

换句话说,它多花的时间,全用在自己给自己质检上了。

就这点,跑分表上你半毛钱都看不到。但恰恰是这点,才是程序员最关心的:它交出来的东西,到底是能跑的Demo,还是能交付的成品?

三个项目全自带测试、控制台零报错、幂等和审计这些细节都想到了。能做到这一步,已经不只是会写代码了,它知道正经交付物长什么样。

5 最后说句实在话

跑完这三个场景,我之前对Qwen的偏见,基本碎干净了。

功能上和K3打平,工程严谨度甚至还略胜一筹。

当然折扣还是要打:它拿到的需求更完整,占了便宜;也没经过真实老项目的毒打,复杂遗留系统表现怎么样,还不好说。

但就算扣完这些分,结论也很明确:人家早就不是当年那个编程不行的Qwen了。

今年这种打脸我已经经历三次了,GLM 5.2一次,K3一次,这次是Qwen。

一次是巧合,三次就是趋势。国产大模型这波,是真的追上来了。

最近也刷到不少相反的说法,有人说这是PPT模型,有人就留一句“拉胯”。我也不知道他们到底测没测,反正我这三个场景跑下来,体验是真还行。

最后给你们个最实在的建议:别信跑分,别全信我这篇,也别信网上没头没尾的一句评价。

现在Qoder新用户能领一千多次免费调用,你自己下个软件,拿你手头真实的需求跑一遍。你自己的活能不能干,你自己最有发言权。

P.S. 挖到宝藏AI教程!全程通俗易懂,风趣幽默,零基础轻松入门,传送门https://blog.csdn.net/qq_34419312

更多推荐