logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从「不敢发」到「天天发」:AI Agent 时代的 CI/CD 生存指南

本文以a1 CLI工具为例,探讨AI生成代码的信任机制构建。面对AI代码的随机性,团队建立多层自动化门禁体系:代码覆盖率检查、真实API冒烟测试、文档同步校验等,并设计逃生舱机制保持灵活性。针对AI新增代码,开发动态冒烟测试流水线,通过Schema约束、Prompt工程、Deny-list机制等五重锁驯服AI随机性,并引入CI历史反馈让AI从失败中学习。最终通过渐进式发布流程(Beta灰度->人工

文章图片
#人工智能#ci/cd
阿里开源 skill-up:让 Agent Skill 可评测可回归

摘要: 阿里巴巴开源了Agent Skill评测框架skill-up,旨在解决AI技能开发中的质量验证难题。该框架通过声明式YAML配置支持多引擎测试,提供expect+judge分层判定机制,降低LLM抖动对CI的影响。核心设计包括:1) 声明式评测配置,提升可读性;2) 分层判定策略优化资源消耗;3) 多引擎适配能力;4) 结构化报告输出,支持CI集成。skill-up特别强化了多轮对话测试,

文章图片
#开源
Agent 评测:方法论与体系设计

本文探讨了Agent评测体系化的必要性及方法论。作者指出,与传统软件不同,Agent的智能行为具有非确定性、黑盒化和错误级联放大等特点,仅凭抽查无法保证稳定性。评测体系需嵌入研发全流程,形成闭环优化。 文章提出评测应区分Agent类型(任务型、对话型等)并定制指标,对话Agent需关注多轮会话效果。评测指标体系应包含P0-P2三级指标,任务型Agent需特别关注"连续成功率"。数据集建设应聚焦高风

文章图片
#人工智能#大数据#算法
阿里荣膺 ACL 2026 最佳资源论文 | HSCodeComp 揭开智能体「分层规则应用」的能力鸿沟

先从任务本身说起。HS Code(Harmonized System Code,商品名称及编码协调制度)是支撑全球每年约 26 万亿美元贸易的商品"唯一数字身份证"。每一笔跨境货物通关都必须申报 HS Code,它直接决F f f F f定了超过所有跨境商品的关税计算和合规性,跨境商品的编码如果报错,轻则多缴关税,重则触发合规风险和货运延误。如下图1所示,在阿里巴巴跨境电商海关商品编码(HS Co

文章图片
为什么 Agent 时代,大家都在做 CLI ?

AI时代的CLI复兴:从人类友好到Agent友好的范式转变 随着AI Agent的崛起,命令行界面(CLI)正经历一场复兴。本文探讨了人机交互从CLI到GUI,再到Agentic CLI的发展历程,指出CLI因其文本输入输出特性、自描述性、Unix哲学组合能力等优势,成为AI Agent操作数字世界的高效入口。文章提出未来产品设计需兼顾人类和Agent需求,分为完全面向人、完全面向Agent和人机

文章图片
Cloud Use:当 Agent 开始真正使用云

文章摘要: 本文探讨了云原生时代下AI Agent(Qoder Cloud Agents)如何从简单的工具调用(Tool Use)升级为受治理的云上工作负载(Cloud Use)。传统云计算围绕人类操作和确定性程序设计,而Agent作为新型执行体,需解决身份、权限、审计等生产级问题。通过场景对比(如周期性任务自动触发、诊断任务主动取证、执行任务受控治理),作者指出Cloud Use的核心是让Age

文章图片
为什么大模型的缓存命中率能到 90%?

摘要: 大模型推理中,KV Cache(键值缓存)和Prefix Caching(前缀缓存)技术通过缓存历史token的Key/Value,显著降低了重复计算成本,使主流模型的缓存命中率稳定在90%左右。当前技术方向包括优化显存管理(如PagedAttention)、跨请求复用(如vLLM和SGLang的方案)以及突破前缀限制的研究(如Prompt Cache)。商用模型(如GPT-4、Claud

文章图片
#缓存
OpenSandbox 再进化:Credential Vault 让真实密钥不再进入沙箱

OpenSandbox推出Credential Vault功能,革新AI Agent安全机制。该方案将真实API密钥等凭据隔离在沙箱外部,由egress sidecar在出站请求时按规则动态注入,避免密钥暴露在沙箱环境变量、日志等高风险区域。通过精确绑定请求范围(host/path/method等),实现"工具正常使用,密钥永不入箱"的安全效果,适用于模型API调用、Git操作等场景。结合默认拒绝

文章图片
Qoder 工程实践:当瓶颈从模型转移到人

摘要: AI编码工具从辅助转向自主执行,带来效率革命的同时也暴露人类注意力的瓶颈。作者经历了从Cursor的代码补全到Opus CLI Agent的自主任务完成,再到多线程并发的尝试,最终通过分层委派(需求→精炼→执行)实现角色转变——仅做决策而非执行。关键在于构建持续运行的"睡后Token"系统,让AI夜间处理任务,次日交付可审核结果。这一过程依赖严格的分层上下文管理(AGENTS.md等)和自

文章图片
后端架构 AI Friendly 的标准与路径:面向无人值守开发时代的系统重构

过去十几年,互联网软件的后端系统核心目标大多围绕「人类工程师友好」展开:架构要清晰,接口要稳定,日志要可查,监控要完整,发布要可控,故障要可回滚。这些原则并没有过时,但在 AI Coding、Agentic Coding、Vibe Coding 逐渐进入工程现场之后,一个新的问题出现了:如果未来大量开发、排障、重构、测试、发布工作不再完全由人类手动完成,而是由 AI Agent 7 × 24 小时

文章图片
#重构
    共 45 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择