我这段时间一直在琢磨自己整一个agent。这原因嘛,想必大家都懂,这天杀的anthropic不知道上辈子遭了咱们什么样的迫害,逮着咱就是一通乱封。

所以整一个属于自己的agent 是一件势在必行的事情了。

这不,Bubble Code (初始版本)就来了嘛!

(Claude Code: 你问我几分像从前。。。)

但其实一直还有两个问题困扰着我,一个是大部分的agent完成任务就是写完就算完了,有的就算说明了你要测试验证,它也会给你瞎写,还有一件事是,现在存的Skills实在太多了。

该怎么让Agent 在完成任务的同时,要交给我一个至少它自己经过五六七八轮仔细验证过的结果?以及成堆的Skills 除了盲目的删掉之外,有没有什么好的方法让他们有效的组合利用起来?

正好我这两天在GitHub上大刷特刷的时候,还真让我发现个宝藏项目,

OpenSquilla。

他们刚刚升级到了0.4.1 版本。

我体验了下来,觉得它有几个做的非常有意思的地方,给了我启发。正好也给大家分享分享。

第一个,是coding task ,是专门用来做代码任务上的。

一般的agent 让它写代码,其实没啥毛病,都能写。但是写完之后也就是写完了,你也不知道它到底写了啥,有没有通过单元测试,就算没能通过,它也有可能给你伪造一条测试,说自己代码写的没毛病。

Coding task 就是为了解决这个问题的。

它会让Agent 写的代码必须全部通过测试之后,再停下,来提高交付的质量。

举个例子来说。

我最近特别喜欢下五子棋。但是这个五子棋绝对不是超级简单的那种我左右脑互搏,一会儿当黑棋,一会儿当白棋,来体验AI生成的前端的,那太低级了。

我想要的是至少有点难度,有点体验的,是有算法在背后的。

我尝试用MCTS ,也就是蒙特卡洛树搜索来作为我这个五子棋背后的算法。

(OK,你不用管MCTS的具体原理,只要知道用了它之后,你如果一个不当心,还真有可能下不过机器)

我的需求其实很难评,又要尽可能难,又要注意用户的游戏体验,然后我又只配了deeepseek 模型。活生生一副又要马儿跑,又要马儿不吃草的样子。

它会识别到这个是代码任务之后,会自动给我启动code-task。 然后开始给我哐哐一顿写。

可以看到哪怕我用的是deepseek 的flash 模型,它也要花将近10分钟才能写好这个HTML文件,因为大部分的时间都用来进行测试验证了。

一个任务,通过了21个测试验证。

然后我随机玩了一把,录了一个屏,让大家感受一下它通过有效的测试的coding task 做出来的效果。哪怕这个模型是一个一般的模型。

靠北,我还下不过它哈哈啊哈。 这个体验也确实蛮好的,没有让我等待很长的时间。

第二个就更加有意思了,是MetaSkill,称之为元技能。

Squllia内置了5个元技能。

它和我们日常普通的说的Skills最大的区别就就在于,

我们平时说的Skills 其实是一个单点能力、一个任务模式、一组提示词或脚本。

但是Meta Skill更像是一个工作流,它自动把所需要的多个Skills都联结起来,进行编排,组成一个可以稳定运转的流程。

举个例子,比如我有一个任务是写一篇关于loop engineer 的论文。

我可以直接通过meta skills 唤起内置的meta-paper-write 来进行写作。

OpenSquilla 会自动开始执行这个Meta Skill,核对需要具备的条件。比如这里就会问我想要写的topic 是什么,然后希望的论文风格是什么样的。

等我填写、选择好之后,会发现OpenSquilla会帮我把我的偏好,以Prompt的形式再输入给模型。

而且这里其实有个细节是,OpenSquilla 在这里不是光单纯依赖一个模型的,它的内部机制里其实有个路由机制在帮你判断什么任务在什么样的阶段,适合什么样的模型。

主要目的其实就一个,省钱

就我相信大家不用我说也能感受到,

Agent时代对吧,Token烧起来真是肉疼。我的AI可能不疼,但我这心里是真疼。所以但凡有一个产品能愿意帮用户省Token的,我都要拍手叫好!

而且官方还特地跑了个测试,对于用路由,多模型组合这件事儿。

一共25个任务,在OpenClaw里用Claude Opus 4.7 得分是0.9255,总成本是6.233; 但是在OpenSquilla 里,多个模型组合起来用,得分非常接近,但是成本只有0.68美金。。。

真的便宜到夸张了。。。

OKK,然后我们回来,接着可以看到这个meta skills 开始工作了。

整个流程其实还是蛮复杂,它不是一般我们常见的那种一个Skill对应一个任务。

大体上是这样一个思路:

我又去翻了一下它的这个meta skill的md 文档,

是直接把多个Skill 组合在了一起,每个写论文的阶段,都有一个对应的Skill; 、

这样,它在运行的过程中,会自动派出多个子代理来完成章节的书写。

子代理写完所有章节之后,最后还会派一个agent 来专门负责全文的修订。

最后展示一下它写的论文,还挺有模有样的:

用Latex 排的版,非常专业。

这可是我一句话就吐出来的产物!下次老板问我啥是loop engineer 的时候,我就可以把这个玩意交给它了。

Agent发展到现在这个阶段,其实已经不只是模型之间的竞争了。

大家都知道模型是底层能力的决定因素,但真正拉开Agent体验差距的,往往是成本控制,Skills的组织方式,任务执行的成功率,以及整个流程是否足够稳定和可验证。

OpenSquilla给我的启发就在这里。

它做的事情表面看是工程优化,但本质上是在解决一个很现实的问题:

如何让Agent在复杂任务里持续稳定且有效地跑完一整条流程,同时不让成本和不可控性一起失控。

当这些能力被系统化之后,AI就不再只是一个会聊天或者会写代码的工具,而是可以真正进入生产流程,去承担具体交付结果的执行单元。

模型会持续进化,但真正能沉淀下来的,是一整套把任务稳定跑通的方法论,是把不确定性一点点减小的工程能力。

很多时候,决定上限的是你能不能把一堆看起来很聪明的能力,组织成一个真正靠谱的系统。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

在这里插入图片描述

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

更多推荐