
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
没有评测体系的 AI 产品迭代是什么状态?更新不知道变好还是变坏,出了问题永远要等用户投诉,复现之后才能修掉,然后祈祷没有引入新的问题。大模型和传统软件有一个根本不同:传统软件是确定性的,同样的输入永远给同样的输出。大模型不是——每次输出都不一样,你改任何一个地方,影响都是发散的。评测要做的事,就是在这个概率系统上建一套闭环机制,让你对系统的每次修改,都有迹可循、有据可查。

没有评测体系的 AI 产品迭代是什么状态?更新不知道变好还是变坏,出了问题永远要等用户投诉,复现之后才能修掉,然后祈祷没有引入新的问题。大模型和传统软件有一个根本不同:传统软件是确定性的,同样的输入永远给同样的输出。大模型不是——每次输出都不一样,你改任何一个地方,影响都是发散的。评测要做的事,就是在这个概率系统上建一套闭环机制,让你对系统的每次修改,都有迹可循、有据可查。

Appium 你用了多少年?它从 2013 年到现在,12 年了。12 年里,移动端自动化测试的格局基本没变——Appium 统治一切。但说实话,。写个测试脚本,要找元素 ID、写 XPath、处理弹窗、适配各种屏幕。脚本写完比业务代码还长,UI 一改全崩。12 年了,一直如此。直到最近,我发现了一个开源项目——

Appium 你用了多少年?它从 2013 年到现在,12 年了。12 年里,移动端自动化测试的格局基本没变——Appium 统治一切。但说实话,。写个测试脚本,要找元素 ID、写 XPath、处理弹窗、适配各种屏幕。脚本写完比业务代码还长,UI 一改全崩。12 年了,一直如此。直到最近,我发现了一个开源项目——

在AI 编程实战的第四个项目中: 我们搭建了一套全栈电商网站。该项目包含用户端商城和管理后台功能,覆盖前端页面、后端接口、数据库设计、业务逻辑全流程,是一个功能完整的电商网站,采用前后端分离架构开发。还记得,这个项目,在开发之初,我们给它的定位吗?我们需要一个贴近真实业务的完整实战项目,把它作为后续学习AI 智能体、AI 测试的专用演练靶场。
市面上这么多的 Agent 工具,到底应该选哪一个作为主力工具呢?这个问题,是最近一段时间粉丝和学员最常问我的。也难怪大家困惑——从今年 3 月到现在,本地 Agent 逐渐走入大家视野。市面上涌现了一大批优秀产品:国内的有 WorkBuddy、Trae Work、Kimi Work,海外的有最近很火的 Codex、Claude Code,还有 Manus。我自己呢,Codex 和 Claude

市面上这么多的 Agent 工具,到底应该选哪一个作为主力工具呢?这个问题,是最近一段时间粉丝和学员最常问我的。也难怪大家困惑——从今年 3 月到现在,本地 Agent 逐渐走入大家视野。市面上涌现了一大批优秀产品:国内的有 WorkBuddy、Trae Work、Kimi Work,海外的有最近很火的 Codex、Claude Code,还有 Manus。我自己呢,Codex 和 Claude

这是它最硬核的能力。数据清理最怕的是什么?在生产环境执行了 DELETE。严格区分环境:dev / test / prod 三套环境配置隔离生产环境强制终止:识别到 prod 环境,直接终止执行 + 抛出警告日志全留痕:每一步操作都保留记录,方便审计追溯这是数据安全的最后一道防线——哪怕配置错了、参数传错了,也不会对生产环境造成任何破坏。“Flaky Test 是自动化最大的敌人。而 Flaky

测试行业有句老话:“自动化测试的三座大山——跑起来、看明白、修得快。解决的就是最难的那座——修得快。它不会替代你的故障分析经验,不会替代你对业务逻辑的理解,更不会替代你对产品质量的判断。它只是把你从逐条翻日志、手写修复代码、反复验证的循环中解放出来,让你把精力聚焦在更有价值的事情上——复杂故障深度分析、产品质量策略优化、自动化体系持续改进。AI 仅仅只是为了简化或者辅助人工排障,复杂的故障分析仍需

前端开发这几年的工具链在飞速进化——从 jQuery 到 React,从 Webpack 到 Vite,从手写 CSS 到 Tailwind。每一次进化,本质都是在把开发者从低价值的重复劳动中解放出来。Skill 是这个进化路径上的最新一站。它不会替代你思考架构、设计交互、权衡方案——这些是人的核心价值。但它能把写样板代码、查文档写测试、反复调样式、手动交代团队规范这些消磨时间的杂活,统统接管过去








