首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

摘要

闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5 henry 2026-08-20 17:46:23 来源: 量子位 henry 发自 凹非寺 量子位 | 公众号 QbitAI 刚刚,闭源RSI的 钦点严父 来了! 开源AI基础设施公司 Prime Intellect 在最新的一项研究中提出: 借助 多智能体Harness ,可以把监控和具体实现交给更小、...

Prime Kimi henry 量子位 AI开发AI Opus GPT Sol Grok Muse
2026-08-20 1 阅读 约9分钟阅读 henry
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5 henry 2026-08-20 17:46:23 来源: 量子位 henry 发自 凹非寺 量子位 | 公众号 QbitAI 刚刚,闭源RSI的 钦点严父 来了! 开源AI基础设施公司 Prime Intellect 在最新的一项研究中提出: 借助 多智能体Harness ,可以把监控和具体实现交给更小、更便宜的 开源模型, ,从而让“AI开发AI”变得更便宜,甚至效果更好。 在实验中,他们把Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3等18个前沿模型,扔进了一场nanoGPT优化器速通。 结果,开源权重模型Kimi K3搭配Prime Agent Harness后,在原始结果页中跑出了2930步的成绩。 这不仅超过了GPT-5.6 Sol的3042步,距离Claude的旗舰模型Opus 5的2920步也只差10步。 换句话说,在AI研究这件事上, 一套由开源模型和Harness组成的系统,已经能够超过部分顶级闭源模型,甚至逼近第一梯队。 这一方面开始动摇过去那个最经典的RSI剧本: 某个最强闭源模型率先跨过“AI开发AI”的临界点,然后不断自我迭代,把其他玩家越甩越远,最终赢家通吃。 另一方面,Prime Intellect也展示了另一种可能: 模型不一定非得最强,只要底下这套科研机器足够高效,开源模型同样可以靠更高的试错吞吐量追上来。 而这,也进一步展示了Harness这类Agent编排框架,在AI4AI、AutoResearch上的潜力。 这是怎么做到的? nanoGPT优化器速通 简单来说,这次Prime Intellect的实验,就是让十几个前沿大模型,去速通Karpathy那套著名的 nanoGPT训练任务。 不过先澄清一点。 这次并不比谁能凭空发明一个多么原创的新算法。 Prime Intellect做的,是直接把AI扔进一个 目标明确、反馈快速的真实训练任务 里,看它能不能像人类研究员一样,不断提出假设、跑实验、看结果,再继续往下改。 Agent一开始会拿到一份带有baseline超参数的训练脚本,同时只得到一个提示: 现在这套方案还不够好。 至于哪里能变好,怎么变好,没人告诉它: 究竟是换一种更好的预条件方法,给权重和更新幅度加上限和下限,调整学习率schedule,让高学习率保持得更久,还是在训练后期加入权重平均,都得靠Agent自己一点点试出来。 所以,这些实验到最后都只看一个指标: 用尽可能少的training steps,把一个1.24亿参数GPT的验证集loss降到3.28以下。 为了让大家从同一条起跑线出发,Prime Intellect把baseline定在了 3290步。 作为参照,目前公开的最好纪录则是人类的 2600步。 于是呢,整个比赛就变成了从3290步出发,看谁能把这个数字压得更低。 压得越低,说明它找到的训练recipe越高效,也就越接近顶尖人类研究者已经做到的水平。 具体的,参与测试的包括Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM 5.2、Muse Spark 1.1、DeepSeek V4 Pro、Grok 4.6、Muse Spark 1.2、Qwen 3.8等共计18个前沿模型。 每次启动之后,Agent会拿到三样东西: 代码仓库、一份规则手册,以及一条目标指令。 实验统一运行在 8张H200上 ,从这里开始,人类基本退出。 改优化器、写代码、启动训练、比较loss、判断结果是不是噪声、决定下一轮实验做什么,全都由Agent自己完成。 值得一提的是,为了防止它们直接上网抄现成答案,整个过程还被锁进sandbox,并且彻底断网。 实验验证 最终,Prime Intellect一共跑了 153次全自主实验 ,单次最长持续超过8天。 然后,他们先得出了一个多少有点扫兴的结论: 没有任何一次实验,提出了真正意义上的全新方法。 最终有效的那些招数,无论是normalization、学习率调整、权重平均还是各种optimizer技巧,基本都能在已有研究里找到类似思路。 但也正因为大家最后找到的idea差不多,另一个现象反而变得更明显: 真正把模型拉开差距的,不是想到什么,而是怎么把它试出来。 这里咱们先放几个结论: 强模型不会轻易把一个idea判死刑。 弱模型常常一个seed跑差了就放弃,强模型会换seed、重新消融,甚至等recipe变了以后,再把旧方案捡回来重测。 Opus 5重新调β2后刷出了新纪录,Fable 5一次重新探测旧方案,又省下了31个steps。 强模型更会处理噪声。 它们会先判断一个小提升到底来自真实改进还是随机波动,再决定值不值得继续烧算力。 甚至有模型发现,同一个seed重复跑,loss也会因为GPU非确定性发生变化,随后直接围绕这个现象重做实验流程。 强模型还会自己造工具。 Kimi K3会自己写实验函数、比较loss曲线、恢复baseline,甚至搭一个小型数值实验室,先验证Newton-Schulz,再把结论带回真实训练。 而跑得最远的Fable 5,最终做到 2726步。 从3290步baseline,到2600步的人类纪录,中间一共有690步优化空间。 Fable 5已经吃掉了564步,相当于走完其中大约 82% 。到这里,这次实验真正有意思的地方才出来。 因为如果十几个模型最后想到的东西都差不多,那么至少在这种研究任务里, idea本身可能没有大家想象中那么稀缺 。 真正影响成绩的,反而是 能不能多试几个方向,能不能更快排除错误,能不能抓住那些很弱但真实存在的信号,再把它们一轮轮叠起来。 换句话说, 科研能力开始越来越像一个试错吞吐量问题。 而这,也正好解释了Prime Intellect为什么接下来把重点放到了Multi-Agent Harness上。 既然大量工作都落在写代码、跑实验、盯结果、做验证这些环节,那么就没必要每一步都调用最贵的前沿模型。 可以让更便宜的开源模型负责监控和实现,把真正需要判断的环节留给更强的模型。 这样一来, 同样的钱能跑更多实验,同样的实验也能更快跑完。 而当一次试错越来越便宜,AI科研能力的提升,也就不一定非得等下一个更强的大模型。 把底下这套“试错机器”造得更好,本身就能继续把成绩往上推。 所以Prime Intellect下一步还准备把Speedrun扩展到训练栈的更多环节,同时继续放大实验规模。 从这个角度看,Multi-Agent Harness真正想加速的,也不只是nanoGPT。 它想加速的是AI研发本身的迭代速度。 这其实还真有点像OpenAI研究员 翁家翌 之前在Why Not TV里提到的一个判断: 对于人类研究员来说,idea本身往往很便宜。 大家能想到的方向,可
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱