
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Qwen3.5 这次发布,不只是一次版本更新。当 35B 可以挑战 235B,说明模型竞争已经不再单纯依赖规模。真正的变量开始转向:训练策略、数据质量、强化学习对齐、工程效率。参数时代没有结束,但它不再是唯一答案。接下来几年,大模型竞争的主战场,可能会更偏向“谁更稳、谁更省、谁更好落地”。这才是值得持续关注的方向。
AI 正在从“聊天系统”变成“能力系统”。在这种架构下:Skills 是能力模块MCP 是工具连接层Agent 是调度系统如果你正在做:AI Agent自动化系统MCP工具企业AI应用那么 Skills 这种能力封装方式,很可能会成为下一代 AI 工程的重要模式。
上个月,一个读者在后台给我留言。他说自己用了半年大模型,写提示词越来越顺手。但最近被一个问题卡住了:想让模型自动处理邮件,读到“需要报销”就填表单,读到“请假申请”就走审批。折腾了两周,要么模型不会调用接口,要么调对了但忘了上一步的结果。他问:这玩意儿到底怎么才能“干活”?我说:你需要的不再是大模型,是AI Agent。今年Agent这个词火得不像话。AutoGPT刚出来那周,GitHub上狂揽6
现在,我每天打开Claude,不再需要像传教士一样念叨那些重复的规则。一句“帮我review这段代码”或“写周报”,它就知道该用什么样的语气、什么样的格式、什么样的流程来干活。这种感觉就像是给Claude发了一张“上岗证”,它终于变成了真正了解我工作习惯的专属助手。其实Skill的门槛比你想象的低得多。你不需要会写复杂的代码,只要会用Markdown把你的工作流程写清楚,Claude就能学会。如果
接口自动化发展到今天,很多团队已经不缺工具,也不缺框架。真正缺的是一种更高效的落地方式。让测试人员少花时间在重复配置上, 让平台自动理解接口文档, 让智能体自动规划接口链路, 让执行过程完整可追踪, 让测试结果真正能说明业务质量。这才是接口自动化下一阶段真正值得关注的方向。如果你也想看看接口测试智能体到底怎么执行用例,欢迎来体验爱测智能化测试平台。
一个接口测通了,不代表 AI 功能能上线。一个问答结果看起来没问题,也不代表这个版本真的可用。这两年,很多团队一边接入大模型,一边沿用原来的测试思路:提测、冒烟、回归、上线。流程看上去没变,但项目一落地就开始暴露问题。同样一句问题,模型今天答得不错,明天可能就偏了。离线评测分数很好,线上用户照样投诉“不好用”。功能链路没报错,业务方还是说效果不稳定。最后一轮复盘时,大家会发现:不是没人做测试,而是
这类小定制表面看起来不重要,实际上很影响长期体验。一个你愿意每天打开、愿意一直用下去的工具,往往不是靠一个大功能赢下来的,而是靠大量小细节慢慢积累出来的。很多人以为,Claude Code 拼到最后,比的是谁提示词更会写。真正拉开差距的,往往不是这个。而是你有没有把它放进一套稳定的工程习惯里:复杂任务先计划改完必须验证上下文脏了就清规则能沉淀就沉淀机械动作尽量自动化高风险操作一定设边界能并行的任务
最近 AI 影像圈有两个工具很值得关注。一个是 OpenAI 的,官方介绍里强调了更强的文字渲染、多语言支持和视觉推理能力;另一个是字节的,官方介绍里明确提到它采用统一的多模态音视频生成架构,支持文本、图像、音频、视频输入。这两个工具放在一起看,意义就不一样了。以前普通人做短视频,最难的是这几件事:不会拍摄。不会布光。不会剪辑。不会做分镜。不会设计画面。想做账号,但一想到素材、脚本、画面、剪辑,就
Browserbase Skills 开源,表面上是给 Claude Code 增加浏览器自动化能力。但从技术趋势看,它代表的是 Agent 能力边界的一次扩展。理解文本 → 生成内容 → 生成代码打开系统 → 操作页面 → 执行任务 → 记录过程 → 反馈结果这就是从“文本智能”到“操作智能”的变化。对开发者来说,它意味着 AI Coding 不再只是生成代码,而是可能逐步进入验证、调试、回归和
同一个需求,有人半天写完用例,有人十分钟交付一套完整测试方案。差距不是经验,也不是加班。而是——有没有用对工具。很多测试同学现在的状态是:需求一来,先自己读一遍,再手动拆测试点写用例靠经验,边界靠补自动化脚本一条条写,改一次需求全跟着改看起来很努力,但效率一直上不去。更现实的问题是:你以为大家都在这么做,其实已经不是了。现在一部分团队的做法是:需求直接丢给模型,先出一版用例自动补齐边界条件顺带生成







