2026 年 5 月,去哪儿旅行基础架构负责人李佳奇在 AiDD 研发数字峰会做了题为《去哪儿旅行 L3 AI Coding 的研发平台与 Skills 实践》的分享1。

讲述里提到的最有用的,不是「Cursor 还是 Claude Code 哪个更强」,而是一个更底层的问题:当研发组织决定全面推广 AI Coding 时,该先建什么? 去哪儿给出的答案轮廓很清晰:先度量,再分级,用 Harness 管住过程,用平台和 Skills 把个人经验沉淀成组织能力。

📌 下文按四条线展开:等级语言(L0–L5)→ 过程控制(Harness)→ 落地路径(四步依赖链)→ 组织资产(Skills)。个人用得爽,和组织接得住,往往是两件事。


一、问题从哪来:为什么「全员 AI Coding」还不够?

1. 个人提效与组织交付的裂缝

AiDD 上海站多场分享指向同一个现象:AI Coding 工具普及后,个人写代码更快了,组织交付未必同步变快2。代码生成量、工具活跃人数上涨,需求到上线的周期、跨团队等待、返工率却可能停在原地。

去哪儿的公开材料里,业务研发团队长期维持较高出码率——据 AiDD 系列报道引演讲披露,数百人规模团队出码率 75% 以上3。但分享同时强调:出码率是观测点,不是终点。没有 Harness 和效果指标兜底的高出码率,可能只是在更快地制造待审查、待测试的中间产物。

2. 过程指标 vs 效果指标

李佳奇在分享中把指标分成两类。过程指标回答「AI 有没有进入现场」;效果指标回答「现场有没有真的变好」。

类型典型指标回答什么单独使用的风险
过程出码率、需求覆盖率、工具活跃、自动化水平AI 参与了多少研发活动变成 KPI 竞赛,忽视质量与交付
效果交付周期、缺陷逃逸率、返工率、业务价值这些活动是否产生真实收益周期长、难归因,但不能因此放弃

李佳奇分享中提及用「量 × 成熟度」组织度量维度4(该公式表述仅见于二手解读,未在大会官网核对原文)——过程看规模,质看自动化水平与 Harness 成熟度。

更稳妥的做法,是把过程指标串成一条证据链:覆盖率证明「用起来了」→ 出码率证明「参与深了」→ 交付周期和缺陷率证明「值不值」。 缺了最后一环,管理层看到的只是「AI 很忙」。

3. 不再纠结 Prompt 技巧,而是回答四个工程问题:
  • L0–L5:团队现在在哪个等级,下一阶段去哪里
  • Harness:AI 参与研发时,谁触发、谁约束、谁审查
  • Tool → Infra → Automation → Insight:落地四步及其依赖关系
  • Skills:重复劳动有没有变成可分发、可治理的组织资产

二、L0–L5:给 AI Coding 一套可对齐的「等级语言」

1. 六级定义

去哪儿在演讲中借用了自动驾驶分级,把 AI Coding 分成 L0–L5。这是演讲中的框架定义,不是 ISO 或行业标准3。价值在于给团队一套共同语言——否则有人说「我们用 AI 写代码」指的是 Copilot 补全(L1),有人指的是需求到 PR 的自动交付(L3),讨论根本无法对齐。

等级名称AI Coding 定义(压缩)人的职责
L0全手动完全不依赖 AI 生成或参与流程全部研发活动
L1代码补全与辅助AI 补全片段,人主导编码与决策主要编码、判断、合入
L2部分自动生成AI 生成函数/类/模块,人组装与验收监控、测试、集成
L3有条件自动化人给需求与规范,AI 编码并测试,阻塞时介入定目标、补约束、关键审查
L4高度自动化AI 承担大部分编码、测试、集成与流水线架构、质量验证、核心逻辑
L5完全自动化需求到上线主要由 AI 完成仅异常与重大变更介入
2. L2 → L3 的关键跨越

L2 到 L3 的质变,不是模型从 Sonnet 换到 Opus,而是任务能否被流程承接:

  • L2:AI 产出模块,人负责拼装成可交付物
  • L3:人输入需求与规范,AI 跑通编码和功能测试,只在阻塞时喊人

公开材料指出,这一跨越依赖 Skills 体系化 + 自动化编排平台56。A2M 课程页将其概括为:从工具提效走向 Agentic Coding 平台,通过 SKILL、RULE、CodeWiki 等模块把个人经验变成组织级能力5。

据公开解读披露,去哪儿 2026 年上半年给自己定的方向之一,是提升 L3 自动化任务占比4。对多数团队而言,现实目标在 L2–L3,而非一步到位 L5。

3. 对管理者的三条实操建议:
  1. 按等级配审查强度:L1 可以轻审查;L3 必须在合入、灰度、发布保留人工节点
  2. 按等级定投入:没到 L2 就上马全链路编排平台,容易空转
  3. ❗️ 等级不是越高越好:没有 Harness 的 L3,比有 Harness 的 L2 更危险——产出更快,失控也更快

三、Harness:决定上限的不是模型,是过程控制

🎯 本章核心判断:模型能力会迭代,真正把 AI Coding 锁在「个人玩具」阶段的,往往是缺少 Harness。

1. 业界概念与去哪儿定义的对照

「Harness」近一年在 Agent 工程语境里高频出现,但不同出处含义侧重不同。

维度Anthropic / 工程语境 7社区归纳(Harness Engineering)8去哪儿演讲框架4
核心调用循环 + 工具路由模型之外的一切脚手架AI 研发过程控制能力
关键组件session、harness、sandbox 解耦prompts、tools、hooks、sandboxes、反馈环触发、门禁、隔离、审查
关注点长跑任务、安全边界、可替换实现配置问题而非模型权重问题研发 12 环节里 AI 怎么参与

据公开解读转述4,去哪儿在分享中将研发全链路拆为 12 个环节的 AI 参与控制点:

#环节流程
1需求文档编写AI Draft → 模板约束 → 人工确认
2需求评审缺口识别 → 评审规则 → 关口审查
3方案设计方案生成 → 架构约束 → 专家 Review
4代码编写Skills 触发→ 编码规范 → 隔离环境
5代码测试测试生成→ 覆盖率门禁 → 沙箱执行
6Checklist/Case 编写Case 生成 → 验收标准 → 人工补充
7开发自测自测助手 → 虚拟环境 → 结果校验
8代码 Review风险扫描 → Review 规则 → 人工合入
9QA 测试缺陷分析 → 测试准入 → QA 判断
10自动化回归回归编排 → 隔离执行 → 失败拦截
11灰度验证指标观察 → 灰度策略 → 人工放量
12生产发布发布辅助→ 变更门禁 → 人工审批

Anthropic 把 harness 描述为「调用 Claude 并把 tool call 路由到基础设施的循环」;沙箱负责执行,session 负责持久化事件日志——三者可独立替换7。Addy Osmani 等社区的定义则更为广泛:harness = 模型以外的全部代码、配置与执行逻辑8。

据公开解读转述4,去哪儿的定义更贴近研发流程治理:Harness 衡量 AI 是否被稳定触发、被约束、被隔离、被审查——不是「模型强不强」,而是「参与方式是否可控、可复用、可审计」。去哪儿没有发明 harness 这个词;它做的是把业界正在形成的概念,落进需求→发布的全链路。

2. 四把锁

据公开解读转述4,去哪儿将 Harness 落实为四把锁:

  1. AI 触发机制:在关键环节用 Skills、Workflow、Agent 流程化调用,避免「想起来才用一下 AI」
  2. 约束与门禁:输入模板、编码规范、质量标准、准入条件、失败拦截
  3. 安全隔离环境:AI 执行、测试、回归在沙箱或虚拟环境完成,不直接碰生产
  4. 人工审查节点:需求确认、方案评审、代码合入、灰度放量、生产发布保留人工确认

上表是全景视图;日常落地可先从三个环节试点:

  • 需求评审:AI 做缺口识别 → 规则约束 → 人工关口审查
  • 代码 Review:风险扫描 → Review 规则 → 人工合入
  • 生产发布:发布辅助 → 变更门禁 → 人工审批
3. 与出码率 KPI 的关系

出码率回答「AI 写了多少」;Harness 回答「写得是否可控」。高出码率 + 低 Harness,常见结果是:Review 负担加重、测试欠债堆积、线上风险后置。

李佳奇在 AiDD 系列报道里明确反对把出码率当唯一目标3。过程指标必要,但必须和 Harness、效果指标放在同一张表里看——否则组织只是在统计「更快制造出来的中间产物」。


四、四步落地路径:Tool → Infra → Automation → Insight

去哪儿的落地不是四条平行线,而是严格依赖链。跳步的典型症状:有平台没人用、有数据没闭环、有出码率没交付改善。

反馈优化

反馈优化

反馈优化

Tool 工具引入

Infra 基建接入

Automation 平台编排

Insight 数据采集

1. Step 1 · Tool:先让人用起来

第一步是引入 Claude Code、Codex、Cursor 等头部工具,降低个人使用门槛,同时沉淀 Prompt、Workflow、Review 等最佳实践5。

引入时几个硬约束:成本控制、企业级安全、权限与过程管控、数据采集与治理5。很多人只盯模型能力,忽略「桌面客户端 / 统一 LLM 网关」——没有统一入口,后面的 Insight 无从谈起。

2. Step 2 · Infra:接入研发体系

工具孤立使用,出不了组织效果。Infra 阶段要做的事:

  • Skills 网关:把研发平台接入 AI,统一治理与分发
  • 统一 Rules / Skills 仓库:复用与版本管理
  • 安全治理:审核准入、实时更新

Skills 治理流程(据 AiDD 系列报道引 PPT 披露6):

一线私有验证

PR 提交标准仓库

基础研发审核

Gateway 统一分发

调用观测与迭代

3. Step 3 · Automation:天弦(QDO)编排

据公开解读,去哪儿自研研发自动化平台「天弦」(Qunar Dev Orchestrator,简称 QDO),定位是多 Agent、多 Skills、全链路编排4。A2M 课程页用「Coding Agent 自动化平台」描述同一层能力,强调把需求、能力与流程打通5。

典型 L3 场景(公开材料列举):

场景传统痛点平台能力公开披露效果
一句话需求需求→编码→部署链路长、切换多Agent 编排 + 部署/测试 Skills据解读:分钟~小时级闭环4
JDK 自动升级技术债高风险、人工不敢动OpenRewrite 规则 + Agent 修编译错误据解读:211 应用、93% 编译通过率4
线上异常修复日志排查耗人日志/配置上下文 + 自动修复重试课程页列为应用场景5

复杂业务需求(2PD 以上)在公开材料中还有 Qsuperpowers 等专项框架45,本篇不展开;只需知道:小需求走编排平台,大需求还要额外的任务结构化能力。

4. Step 4 · Insight:QunarDevCenter 与数据飞轮

规模化之后,黑盒必须变白盒。去哪儿的 Insight 层核心是 QunarDevCenter:采集 Claude Code、Codex、Cursor 等 Session 数据,按统一协议上报,关联任务、测试、发布链路,输出出码率、自动化水平、覆盖率等洞察45。

5. 依赖链小结
  • Tool → Infra → Automation → Insight
  • Insight 的价值不只是报表,而是驱动 Skills 迭代、Harness 收紧、平台场景扩展的反馈飞轮

五、Skills 与组织资产:出码率之外,什么在复利?

出码率衡量「量」。Skills 治理衡量「质」和「复用」——AI 能力究竟留在聊天记录里,还是进入组织资产池。

1. 三类核心 Skills

据 AiDD 系列报道引演讲披露6,去哪儿沉淀了三类与 L3 交付直接相关的 Skills:

  1. 一句话需求自动化开发
  2. 自动调试和部署
  3. 性能自动优化

它们支撑的场景包括:JDK/Spring 框架自动升级、业务线规模化小需求交付、生产必修异常自动修复6。Skill 在这里不是「写得更漂亮的 Prompt」,而是流程 + 工具 + 上下文 + 验证标准的组合封装。

2. 治理流程

有效实践先进私有仓库验证,再高价值 Skills 提 PR 进标准仓库,经基础研发审核后通过 Gateway 分发,并记录调用情况反向优化6。这条路的难点不在技术,在愿不愿意把个人摸索变成可审计的组织资产。

3. 角色变化

A2M 课程页有一句直白的定位:开发者从「代码生产者」转向「问题定义者与能力编排者」5。出码率再高,如果没人愿意定义问题、维护 Skills、设计 Harness,组织仍然停在 L1–L2 的个人提效。


六、方案边界与落地建议

去哪儿的路径不是银弹。它假设你已经有一个数百人规模、愿意投入平台与数据体系、且研发流程有一定数字化底座的组织。

1. 适用 / 不适用
场景更适合去哪儿路径不太适合原因
组织规模百人以上多团队研发十人以内产品团队平台建设 ROI 不足
数据合规能建客户端采集 + 白名单上报无法接受行为数据采集Insight 层无法落地
治理意愿愿意审核、分发、维护 Skills只要个人自由使用 AIInfra 层推不动
目标等级追求 L2–L3 规模化仅需 L1 补全提效四步链路过重
2. 可复制的最小起步

不必照搬天弦和 QunarDevCenter,四步可以缩小执行:

✔️ 统一 L0–L5 语言:开一次对齐会,让各组说清楚「我们其实在 L几」
✔️ 一对指标:1 个过程指标(如覆盖率)+ 1 个效果指标(如需求交付周期)
✔️ 一个 Skills 试点:选 JDK 升级、定时任务、配置变更等高频低风险场景,配上审查节点
✔️ 有底座再建平台:采纳率和数据源跑通后,再考虑 Workflow 编排


总结

AI Coding 的上限,越来越取决于研发系统是否为 AI 重新设计——不是多买一个席位,而是度量让它可见、Harness 让它可控、平台让它可编排、Skills 让它可复利。

个人玩具阶段,拼的是谁更会写 Prompt;组织能力阶段,拼的是谁先把反馈环跑通。去哪儿的公开样本可贵之处,在于它把这条路径摊开讲了:先回答「怎么量」,再讨论「怎么管」,最后才谈「怎么自动化」。


  1. https://www.aidd.vip/dhrc-sh2026 (official-blog,AiDD 2026 上海站大会日程) ↩︎

  2. https://www.keylinking.com/gywm/3653.html (secondary,AiDD 系列观察报道,引鲁奕志分享) ↩︎

  3. https://www.keylinking.com/gywm/3653.html (secondary,引李佳奇演讲 PPT 第 8/10 页) ↩︎ ↩︎ ↩︎

  4. https://mp.weixin.qq.com/s/Ug_fMuGkQmM4tECUbpfXOg (secondary,公众号二次解读) ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  5. https://a2m.msup.com.cn/course/19218 (official-blog,A2M 课程介绍页) ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  6. https://www.keylinking.com/gywm/3622.html (secondary,引李佳奇演讲 PPT 第 38/40 页) ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  7. https://www.anthropic.com/engineering/managed-agents (official-blog,Anthropic Engineering,2026-04-08) ↩︎ ↩︎

  8. https://addyosmani.com/blog/agent-harness-engineering/ (community,Addy Osmani) ↩︎ ↩︎

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐