在这里插入图片描述
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/H1727548

1. 先唠唠最近AI圈这桩新鲜事

最近AI圈出了个挺反常识的瓜。

以前所有人都默认,搞“AI开发AI”这种高端活,必须得最贵最强的闭源模型下场才行。

结果现在有人证明,开源模型套个靠谱框架,差点把顶流闭源模型给干下去。

1.1 搞事的是谁?

一家叫Prime Intellect的开源AI基础设施公司,最近搞了场特殊的比赛。

说特殊,是因为参赛选手不是人,是18个当下最前沿的大模型。

从GPT-5.6 Sol、Opus 5到Kimi K3,市面上叫得上号的基本都来了。

2. 这场比赛,到底比的是什么?

说穿了很简单,就是比AI自己搞科研的本事。

具体任务是速通nanoGPT训练,用最少的步数把验证集loss降到指定数值。

2.1 规则狠就狠在,没人教你怎么赢

每个模型上场,就领三样东西:代码仓库、规则手册、一句“现在方案不够好”。

至于哪里不好、怎么改、往哪个方向试,半点儿提示都没有。

调学习率也好,换归一化也罢,甚至加权重平均,全靠自己瞎摸索。

跟把你扔到实验室,导师直接失联,只留个结题要求一模一样。

2.2 全程断网,杜绝抄作业

为了防止模型上网搜现成答案,整个环境直接锁进沙箱,彻底断网。

改代码、跑训练、看结果、判断是不是噪声、安排下一轮实验,全得自己来。

人类除了开机和等结果,基本插不上手。

统一用8张H200跑,起跑线绝对公平。

2.3 胜负标准只有一个数字

baseline是3290步达标,人类研究员的公开最好纪录是2600步。

谁能把步数压得越低,谁就越厉害。

说白了,就是比谁找的训练配方更高效。

3. 跑了153次实验,结果挺有意思

前前后后一共跑了153次全自主实验,单次最长跑了8天多。

最后得出来的结论,说意外也意外,说合理也合理。

3.1 先泼冷水:没人搞出全新黑科技

先说个有点扫兴的结论。

153次实验跑下来,没有任何一个模型,整出了真正前无古人的全新方法。

最后被验证有效的那些技巧,翻一翻现有论文基本都能找到类似思路。

说白了,大家脑回路差不了太多,想到的点子都在人类已有知识圈里。

3.2 真正拉开差距的,是试错的本事

既然点子都差不多,为啥名次能差出几百步?

核心差距,全在“怎么试错”上。

第一,强模型不会随便枪毙一个想法。

弱模型跑砸一次就直接把方案扔垃圾桶,强模型会换种子、做消融,甚至过段时间捡回来再测一遍。

就跟你追对象似的,被拒一次就放弃的都是新手,老手都懂得换个姿势再来。

第二,强模型更会分辨真假提升。

跑出来涨了一点点,到底是真优化了,还是GPU抽风随出来的噪声?

弱模型看见涨分就上头往里冲,强模型会先反复验证,不瞎烧算力做无用功。

第三,强模型会自己造工具。

比如Kimi K3,自己写实验函数,自己搭小型数值实验室,先在小环境里把想法测明白了,再搬到大训练里用。

别人还在徒手搬砖,它已经自己造好脚手架了,效率能一样吗?

3.3 最炸的成绩:开源模型追平闭源第一梯队

说几个核心数字,你们直观感受下。

目前全场第一的Fable 5,做到了2726步,差不多吃掉了从baseline到人类纪录之间82%的优化空间。

最让人意外的是Kimi K3。

配上Prime自家的Agent Harness之后,它跑出了2930步的成绩。

这个数字,已经超过了GPT-5.6 Sol的3042步,离Opus 5的2920步也就差10步。

什么概念?

一个开源权重的模型,靠一套编排框架,在自主科研任务上,已经能打赢部分顶级闭源模型,甚至摸到第一梯队的门槛了。

4. 真正的王炸:多智能体Harness

说到这肯定有人想问,Kimi K3凭啥能这么猛?

核心不是它本身智商碾压,是它用上了Multi‑Agent Harness这套东西。

4.1 搞科研,不用每一步都用最贵的模型

以前大家的思路特别直线:任务越难,越得上最强模型。

但这次实验直接把这个思路干碎了。

自主科研里大量的工作,其实都是写代码、跑实验、盯数据、做验证这种体力活。

这些活,根本用不着旗舰模型亲自下场。

找更便宜、更小的开源模型来干,效果差不了多少,成本能降一大截。

4.2 Harness到底是个啥?

简单说,就是一套智能体编排框架。

贵的大模型留着做决策、定方向、判断关键结果。

便宜的小模型负责执行、监控、跑流程、干杂活。

分工明确,各司其职。

以前是一个顶级专家又画图纸又搬砖又拧螺丝,浑身是铁能打几根钉?

现在是顶级专家只负责拍板,下面一堆熟练工玩命落地,整体效率直接拉满。

同样的预算,能跑更多次实验;同样的实验,能更快出结果。

试错成本一降,迭代速度自然就上去了。

5. 这事的影响,比你想的要深远

表面看是一次模型跑分比赛,实际上是在动摇整个行业的共识。

5.1 经典RSI剧本,第一次出现了变数

以前所有人聊RSI,剧本都是固定死的。

某个最强闭源模型率先跨过“AI开发AI”的临界点,然后自我迭代越跑越快,把其他玩家越甩越远,最后赢家通吃。

但这次实验直接给这个剧本打了个大大的问号。

模型本身不是最强的又怎么样?

只要底下这套科研机器够高效,试错吞吐量够大,开源阵营一样能靠堆迭代速度追上来。

不一定非得靠一个天选模型智力爆炸,攒个高效流水线,照样能往前冲。

5.2 AI研发的核心,正在悄悄转移

以前大家拼了命卷模型本身,卷参数、卷榜单、卷智商。

但现在看来,至少在AI搞科研这件事上,基础设施的权重正在越来越高。

能不能让模型长时间稳定工作?能不能给它顺手的工具?能不能用更低成本跑更多实验?能不能同时验证好几个假设?

这些问题的答案,可能比“模型智商再涨几点”更重要。

未来我们大概率看不到什么突然降临的超级智能爆炸。

更可能出现的,是一台越来越便宜、越来越快、不知疲倦的AI科研流水线。

它不一定每一步都最聪明,但它试得够多、跑得够快,照样能把科研速度推着往前跑。

说白了,决定AI迭代速度的,从来不只有顶端的模型有多聪明。

底下那套帮它不断试错的机器,同样关键。

P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/H1727548

更多推荐