
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
群里测试组的老K连发三条语音,语气像丢了孩子:“完了完了,大模型接口调用量上周冲到日均500万了,我们那200条手工用例还在SVN里躺着,一条条复制粘贴到Postman跑,已经连续加了三天班了。我们遇到过一个case:问“公司几点上班”,旧模型回答“9点”,新模型回答“上午9:00(弹性工作制,最晚10点)”。更重要的是,线上投诉率下降了70%——因为每次模型更新前,那些“看着差不多”的边界问题都
给模型真实 GitHub Issue,让模型修复代码并生成 patch,通过测试验证修复是否成功,从而衡量模型在真实工程场景中的代码能力。OpenAI 弃用 SWE-bench Verified,并推荐使用更严格的 Pro 版本,本质上是一次评估体系升级。在抽查任务中发现,相当比例的失败案例,并不是模型无法修复问题,而是测试本身存在不合理设计。这条资讯对测试工程师的价值,不在于模型排名变化,而在于

最近,Anthropic 发布了一份 30 多页的 Skill 创建指南,系统讲解如何为 Claude 构建自定义能力模块。当 Skill 混乱时,调度逻辑会指数级膨胀。第一,能力沉淀成为可能。重复逻辑不再写 Prompt,而是封装成 Skill。第一,Skill 是模型能力的结构化延伸。这不是简单的 API 更新说明,而是一份偏工程体系化的能力设计手册。Skill 的定位,恰好在 Tool 与

你现在在测的系统,是一次性调用模型,还是一个会持续运行、不断演化的Agent系统?AI测试的核心,正在从“验证结果”,转向“约束系统行为”这类问题,本质上不是模型能力的问题,而是系统形态变了。当系统变成“持续运行的Agent”,测试对象也变了。AI正在从“被调用的能力”,变成“持续运行的系统”Agent正在从“能力调用”,变成“系统工程问题”没有Dreaming的Agent,本质是一次性工具。有些
API密钥:sk-GyX66j2M7ohdzry8z1MVGZxwbzn5SkbWVBYFCw8qiEnb5We64Kt0n5xpek6R3z6l。打开https://oneclaw.cn 根据你的系统,选择对应的版本下载安装即可!此版本无需命令行,一键安装,1 分钟上手!初次安装填写完成后就可以点击保存并继续了!验证成功后就可以使用龙虾了!接口地址:https://opencode.ai/zen
我们关注测试工程能力的系统化建设,包括 Python 自动化测试、Java 自动化测试、Web 与 App 自动化、持续集成与质量体系建设,同时探索 AI 驱动的测试设计、用例生成、自动化执行与质量分析方法,沉淀可复用、可落地的测试开发工程经验。在技术社区与工程实践之外,学社还参与测试工程人才培养体系建设,面向高校提供测试实训平台与实践支持,组织开展 “火焰杯” 软件测试相关技术赛事,并探索以能力
同时,真实世界里的 AI 事故也在增加。更关键的是,Anthropic 官方文档并没有把这类能力包装成“已经无风险的成熟替代方案”,相反,它明确提示了几类风险:提示注入、敏感信息泄露、对互联网内容的错误跟随,以及需要人类确认的重要操作。教育部这两年的公开表述,重点已经不是“要不要碰 AI”,而是如何把 AI 素养和应用能力更系统地推进到教学场景里,朝“公共课、基础课”的方向走。这套闭环的重点,不是
更高效的方式,其实是把它放进一套完整的开发习惯里:会规划、会验证、会收口、会沉淀规则、会控制边界、会并行推进。但同样是用 Claude Code,有人越用越顺:查代码、修 Bug、补测试、做重构、看 PR,一整套流程越来越丝滑。一个你愿意每天打开、愿意一直用下去的工具,往往不是靠一个大功能赢下来的,而是靠大量小细节慢慢积累出来的。如果是表单、弹窗、权限、跳转、列表刷新这类改动,尽量让它看到真实效果

本文将结合测试开发的实际工作场景,拆解这套“自我进化”的机制,并给出测试开发在 AI 项目中可以扮演的角色和具体代码示例。更进一步,当测试脚本因 UI 变化而失效时,你可以告诉 Agent:“这个元素的定位器变了,以后遇到类似情况,优先使用 data-testid,如果没有再用 XPath。Agent 需要你带它熟悉你的工作流程、你的偏好、你们团队踩过的坑。如果你也是测试开发,不妨从今天开始,为自







