开源逆袭闭源!18款大模型自主科研实测,结果颠覆行业认知
文章目录
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/H1727548
1. 先唠唠最近AI圈这桩新鲜事
最近AI圈出了个挺反常识的瓜。
以前所有人都默认,搞“AI开发AI”这种高端活,必须得最贵最强的闭源模型下场才行。
结果现在有人证明,开源模型套个靠谱框架,差点把顶流闭源模型给干下去。
1.1 搞事的是谁?
一家叫Prime Intellect的开源AI基础设施公司,最近搞了场特殊的比赛。
说特殊,是因为参赛选手不是人,是18个当下最前沿的大模型。
从GPT-5.6 Sol、Opus 5到Kimi K3,市面上叫得上号的基本都来了。
2. 这场比赛,到底比的是什么?
说穿了很简单,就是比AI自己搞科研的本事。
具体任务是速通nanoGPT训练,用最少的步数把验证集loss降到指定数值。
2.1 规则狠就狠在,没人教你怎么赢
每个模型上场,就领三样东西:代码仓库、规则手册、一句“现在方案不够好”。
至于哪里不好、怎么改、往哪个方向试,半点儿提示都没有。
调学习率也好,换归一化也罢,甚至加权重平均,全靠自己瞎摸索。
跟把你扔到实验室,导师直接失联,只留个结题要求一模一样。
2.2 全程断网,杜绝抄作业
为了防止模型上网搜现成答案,整个环境直接锁进沙箱,彻底断网。
改代码、跑训练、看结果、判断是不是噪声、安排下一轮实验,全得自己来。
人类除了开机和等结果,基本插不上手。
统一用8张H200跑,起跑线绝对公平。
2.3 胜负标准只有一个数字
baseline是3290步达标,人类研究员的公开最好纪录是2600步。
谁能把步数压得越低,谁就越厉害。
说白了,就是比谁找的训练配方更高效。
3. 跑了153次实验,结果挺有意思
前前后后一共跑了153次全自主实验,单次最长跑了8天多。
最后得出来的结论,说意外也意外,说合理也合理。
3.1 先泼冷水:没人搞出全新黑科技
先说个有点扫兴的结论。
153次实验跑下来,没有任何一个模型,整出了真正前无古人的全新方法。
最后被验证有效的那些技巧,翻一翻现有论文基本都能找到类似思路。
说白了,大家脑回路差不了太多,想到的点子都在人类已有知识圈里。
3.2 真正拉开差距的,是试错的本事
既然点子都差不多,为啥名次能差出几百步?
核心差距,全在“怎么试错”上。
第一,强模型不会随便枪毙一个想法。
弱模型跑砸一次就直接把方案扔垃圾桶,强模型会换种子、做消融,甚至过段时间捡回来再测一遍。
就跟你追对象似的,被拒一次就放弃的都是新手,老手都懂得换个姿势再来。
第二,强模型更会分辨真假提升。
跑出来涨了一点点,到底是真优化了,还是GPU抽风随出来的噪声?
弱模型看见涨分就上头往里冲,强模型会先反复验证,不瞎烧算力做无用功。
第三,强模型会自己造工具。
比如Kimi K3,自己写实验函数,自己搭小型数值实验室,先在小环境里把想法测明白了,再搬到大训练里用。
别人还在徒手搬砖,它已经自己造好脚手架了,效率能一样吗?
3.3 最炸的成绩:开源模型追平闭源第一梯队
说几个核心数字,你们直观感受下。
目前全场第一的Fable 5,做到了2726步,差不多吃掉了从baseline到人类纪录之间82%的优化空间。
最让人意外的是Kimi K3。
配上Prime自家的Agent Harness之后,它跑出了2930步的成绩。
这个数字,已经超过了GPT-5.6 Sol的3042步,离Opus 5的2920步也就差10步。
什么概念?
一个开源权重的模型,靠一套编排框架,在自主科研任务上,已经能打赢部分顶级闭源模型,甚至摸到第一梯队的门槛了。
4. 真正的王炸:多智能体Harness
说到这肯定有人想问,Kimi K3凭啥能这么猛?
核心不是它本身智商碾压,是它用上了Multi‑Agent Harness这套东西。
4.1 搞科研,不用每一步都用最贵的模型
以前大家的思路特别直线:任务越难,越得上最强模型。
但这次实验直接把这个思路干碎了。
自主科研里大量的工作,其实都是写代码、跑实验、盯数据、做验证这种体力活。
这些活,根本用不着旗舰模型亲自下场。
找更便宜、更小的开源模型来干,效果差不了多少,成本能降一大截。
4.2 Harness到底是个啥?
简单说,就是一套智能体编排框架。
贵的大模型留着做决策、定方向、判断关键结果。
便宜的小模型负责执行、监控、跑流程、干杂活。
分工明确,各司其职。
以前是一个顶级专家又画图纸又搬砖又拧螺丝,浑身是铁能打几根钉?
现在是顶级专家只负责拍板,下面一堆熟练工玩命落地,整体效率直接拉满。
同样的预算,能跑更多次实验;同样的实验,能更快出结果。
试错成本一降,迭代速度自然就上去了。
5. 这事的影响,比你想的要深远
表面看是一次模型跑分比赛,实际上是在动摇整个行业的共识。
5.1 经典RSI剧本,第一次出现了变数
以前所有人聊RSI,剧本都是固定死的。
某个最强闭源模型率先跨过“AI开发AI”的临界点,然后自我迭代越跑越快,把其他玩家越甩越远,最后赢家通吃。
但这次实验直接给这个剧本打了个大大的问号。
模型本身不是最强的又怎么样?
只要底下这套科研机器够高效,试错吞吐量够大,开源阵营一样能靠堆迭代速度追上来。
不一定非得靠一个天选模型智力爆炸,攒个高效流水线,照样能往前冲。
5.2 AI研发的核心,正在悄悄转移
以前大家拼了命卷模型本身,卷参数、卷榜单、卷智商。
但现在看来,至少在AI搞科研这件事上,基础设施的权重正在越来越高。
能不能让模型长时间稳定工作?能不能给它顺手的工具?能不能用更低成本跑更多实验?能不能同时验证好几个假设?
这些问题的答案,可能比“模型智商再涨几点”更重要。
未来我们大概率看不到什么突然降临的超级智能爆炸。
更可能出现的,是一台越来越便宜、越来越快、不知疲倦的AI科研流水线。
它不一定每一步都最聪明,但它试得够多、跑得够快,照样能把科研速度推着往前跑。
说白了,决定AI迭代速度的,从来不只有顶端的模型有多聪明。
底下那套帮它不断试错的机器,同样关键。
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/H1727548
更多推荐
所有评论(0)