Agent 也能自我进化?LlamaFactory 作者的新开源项目 30 天拿下 1466 星

凌晨两点,Hacker News 上吵翻了天。一条置顶帖,4229 个赞,标题只有一句话:“Don’t post generated/AI-edited comments. HN is for conversation between humans”。AI 生成的内容正在淹没社区,人类在评论区里互相要求“说人话”。

讽刺的是,同一天,GitHub 上最火的开源项目,干的事情恰恰相反——它想让 AI 自己写 AI。

Prism-Shadow/penguin-harness,7 月 19 日创建,30 天拿下 1466 颗星、143 个 fork。项目简介只有一句话:🐧 Harness for RSI. Let AI Build AI。

RSI,Recursive Self-Improvement,递归自我改进。 这不是又一个“帮你写代码”的工具,而是一个让 Agent 自己造 Agent、自己优化自己的框架。

而它的作者,是 Yaowei Zheng(hiyouga)——LlamaFactory 的作者,那个被无数人用来微调大模型的开源项目。

最狠的对比:1/70 的成本,更高的准确率

项目 README 的第一句话就拉满了火药味:

With LangChain, you build agents by hand — at 1× speed. With PenguinHarness, agents build agents — at 100×.

用 LangChain 手搓 Agent,是 1 倍速;用 PenguinHarness,Agent 建 Agent,是 100 倍速。

凭什么?它给了一组官方基准测试数据:在数据分析任务上,准确率全场最高,而成本只有 Claude Code 的 1/70;在编程任务上,和 OpenAI Codex 打平,成本也只是对方的一个零头。

PenguinHarness 基准:数据分析准确率第一,成本只有 Claude Code 的 1/70

怎么做到的?思路其实很朴素:工具集刻意保持极简。少一次工具调用,就少烧一批 token。它不为“看起来很全能”塞入几百个工具,而是把每个 harness 调教到跟它日常搭配的模型最合拍——比如开源模型,就为 DeepSeek 深度优化。

一句话,让 Agent 给你造一个完整的 RAG 应用

它最出圈的能力,是“一句话建应用”。README 里的例子:

Collect the docs from https://github.com/ericbuess/claude-code-docs and build a RAG app that answers Claude Code questions as a configuration expert, citing its sources.

把文档抓下来,做一个能回答 Claude Code 配置问题的 RAG 应用,要求带引用来源。从脚手架到代码到运行说明,全自动。而整个应用的生成,烧掉的 token 成本是 $0.02(约两毛钱人民币),跑在 DeepSeek V4 Pro 上。

不是 demo 级的玩具,是带检索、带引用链接、带内置示例问题的成品。

自我进化:跑基准、丢分、改自己、发 N+1

如果说“一句话建应用”是炫技,那Skills 机制才是这个项目真正的野心。

它内置了四组技能:数据分析、网页设计、软件工程、AI 应用开发、Agent 调优——其中 Agent 调优组包含 agent-creationbenchmark-designagent-evaluationagent-optimization 四个技能。

看懂这四个词,就懂它的进化逻辑:

  1. 跑一遍 benchmark,找到丢分点
  2. 让 Agent 分析自己哪里不行
  3. 修改策略,发布 N+1 版本
  4. 每轮进化前自动快照,所有请求都能在 Trace 视图里回放

自我进化循环:跑基准、找丢分、发 N+1,每轮自动快照

这不是“调参”,是让 Agent 自己给自己发版本号。 传统开发里,“模型不行就换提示词”是玄学;在 penguin-harness 里,“不行”变成了一个可度量的 benchmark 分数,而修复动作由 Agent 自己执行。

技术选型:桌面 + CLI + SDK,三路并进

它不是纯 CLI 项目,而是铺了完整的产品矩阵:

  • 桌面端:macOS / Windows / Linux 安装包,双击即用,内嵌服务端,免登录
  • CLIpenguin web 一条命令,浏览器里打开 http://127.0.0.1:7364,多会话聊天、Agent 管理、用量统计、评估中心全都有
  • SDK@prismshadow/penguin-core,给 Agent 用的 Agent——可以被别的 Agent 当引擎调用

模型兼容性走“广撒网”路线:预设了 DeepSeek V4、Kimi K3、GLM 5.2、Qwen 3.8 Max、GPT 5.6、Gemini 3.6 Flash、Claude 5 等最新一代模型,同时任何 OpenAI 协议端点都能接,官方说覆盖 1000+ 在线和本地模型。这意味着做多模型对比测试时不用为每个模型单独接 SDK——统一协议入口,切换模型只改一行配置。

数据全存本地 ~/.penguin/data,桌面版和 CLI 版共用同一份数据根目录,换装不换脑。连离线安装都考虑到了:每个 GitHub Release 附带密封了 SHA256 校验和的离线包,断网机器也能装。

关于“AI 建 AI”,该警惕还是该兴奋?

回到开头那条 HN 热帖。社区正在为“AI 生成内容泛滥”头疼,而 penguin-harness 却在加速“AI 生成 AI”。两条新闻放在一起,恰好是 2026 年 AI 行业最真实的张力。

技术路线本身值得肯定:把 Agent 的构建从“手工艺”变成“流水线”,用 benchmark 分数代替玄学调参,这是工程化的胜利。它的路线图里还写着 agent 公司模板、企业级自我进化、OpenShell 权限化 shell 集成——野心不小。

但风险同样真实:当 Agent 开始优化自己,谁来定义“更好”?如果 benchmark 设计有偏,进化方向就会跟着偏。这也是为什么它的路线图第一条,是公开 benchmark 套件——把“自我进化”的评判标准交给社区,而不是关起门来自说自话

这大概才是“Let AI Build AI”的正确姿势:AI 负责建,人类负责定标准。

GitHub TrendingHacker News 公开信息整理,项目数据来自 penguin-harness README官方文档

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐