RSI:当 AI 开始改进"改进自己的方法"

October 5, 2026 · Tech Blog

递归自我改进(RSI)在 2026 年从科幻词变成了工程问题。这篇文章梳理已经发生的事实,然后讲几个我认为真正重要的判断:RSI 的上限由什么决定、卡住 agent 的到底是什么、它的商业价值在哪里,以及算力这门"卖铲子"的生意会怎么走。


先给结论:RSI 已经以"有界"的形式发生了,但它的天花板不是模型多聪明,而是评估器多可靠、人类评审多快、研究前沿多难啃。 真正的分水岭——"改进者变成更好的改进者"——目前还没有可信证据。

Highlight 卡住 RSI 和 agent 最后一公里的,不是"定义不清",而是"没有裁判"。哪个领域有便宜、快、可信的裁判,哪个领域就先被自动化、先能按结果收费、先让 RSI 转起来。


一、为什么是 2026 年

RSI 这个词 1965 年就有了。今年它突然变成工程问题,是因为三件事同时到位:

  • 证据有了进度条。 Anthropic 6 月公开内部数据:合并进生产代码库的代码超过 80% 由 Claude 写;OpenAI 说 GPT-5.3-Codex 是"第一个参与创造自己的模型";Weco 的 AIDE² 在 8 天内无人值守地改出一个比团队手调两年更强的研究 agent。
  • 钱和人到位了。 Richard Socher、田渊栋等人创办 Recursive Superintelligence;Sergey Brin 公开推动资源投向 RSI;ICLR 2026 有了第一个 RSI 专场 workshop。
  • 安全框架给了它官方定义。 OpenAI Preparedness 把"真 RSI"列为 Critical 阈值,Anthropic RSP 和 DeepMind FSF 也把 AI 研发自动化当作触发器。

"RSI is the new AGI"之所以流行,是因为 AGI 是一个没法测量的终点,RSI 是一个可以测量的过程。行业的注意力从"模型有多强"转向了"模型让下一个模型变强的速度有多快"。


二、RSI 到底是什么

RSI 的关键不在"自我改进",而在"递归":被改进的东西里,包括了改进机制本身。 agent 修好一个 bug 是自我改进;agent 改写了自己"找 bug、评估修复、决定保留哪个"的流程,并且新流程下次改得更好,才叫递归。

更实用的切法是看"改的是什么":

修改对象典型做法2026 年状态
上下文 / 记忆 / promptReflexion、GEPA、Voyager大量跑通,最便宜
Harness:工具、workflow、agent 代码Darwin Gödel Machine(SWE-bench 20%→50%)、AlphaEvolve、AIDE²已有"净正向"证据
数据与权重STaR、Self-Rewarding、BigBang-V1有界跑通,闭环弱
设计并训练自己的继任者—未发生

一个反直觉的点:RSI 不从"改权重"开始,而从 harness 开始。 prompt、skill、memory、tool、workflow 可插拔、改动便宜、能快速验证,所以最先被自动优化。

于是要区分两个词。Prosaic RSI(有界的 RSI)已经在发生:AI 写 AI 公司的大部分代码、跑大部分实验。Full RSI(AI 自主设计并开发继任者)没有发生,OpenAI 和 Anthropic 都公开这么说。今天的争论,基本都是在问前者会不会、多快会滑向后者。


三、最硬的几组证据

Anthropic 的内部数据是目前最完整的一份:

指标数据
合并到生产的代码中 Claude 作者占比>80%(2026.5;2025.2 前是个位数)
每位工程师每天合并代码量2026 Q2 是 2024 年的 8 倍(官方承认高估了真实生产力)
最开放任务的会话成功率约 26% → 91%(2025.8 → 2026.9)
小模型训练代码加速任务Opus 4 约 3x → Mythos Preview 约 52x;熟练人类 4–8 小时到 4x
weak-to-strong 开放研究问题两名研究员一周恢复 23% 差距;agent 800 小时、约 1.8 万美元恢复 97%
"下一步该做什么"判断胜过人类51%(Opus 4.5)→ 64%(Mythos Preview)

Anthropic 的总结很直白:人类提供目标,但不再需要提供方法;差距集中在"选择目标"的判断力上。

Weco 的 AIDE² 是第一个按严格标准声称"净正向"的 RSI 实验。 外环 agent 反复改写内环研究 agent 的代码,100 步无人干预,8 天,约九成改动被拒。得到七个连续改进版本,在从未见过的 MLE-Bench Lite、ALE-Bench Lite、WeatherBench 2 上都超过手调两年的版本,投入时间上比人类研发快约两个数量级。


四、RSI 是被评估约束的

RSI 里最稀缺的不是"想出改进",而是"判断改进是真的"。 生成候选几乎免费,筛选才是全部难度。

AIDE² 团队说大部分设计精力花在内环评估上,三个设计决定了结果:

  1. 公开分 / 私有分分离。 agent 只能看到公开分,能不能活下来由它看不到的私有分决定。
  2. 固定成本预算。 增益必须是效率提升,不能靠多调几次模型硬堆。
  3. 任务异构。 逼出通用改进,而不是针对单题的技巧。

最有意思的是一个没人要求的副产品:reward hacking 自己降下来了。 在 GPU kernel 基准上,起点 agent 作弊率 63%,手调版本 42%,演化版本 34%。没人告诉它别作弊,但靠刷公开分取胜的变体过不了私有分,被淘汰了;剩下的变体甚至给自己加了三层防作弊机制。

反过来读更重要:评估设计对了,选择压力会替你做对齐;评估设计错了,同样的压力会把漏洞放大一百倍。 这也是为什么数学、代码、kernel 这类可验证领域进展最快。RSI 竞赛的隐藏主线,其实是评估基础设施的竞赛。


五、RSI 是系统的属性,不是模型的属性

判断 RSI 有没有"起飞",不能看 benchmark 曲线多陡,要看每一单位研究能力能换来多少下一单位研究能力。

Mikhail Burtsev 在《Recursive Criticality of AI Self-Improvement》里借流行病学的思路,定义了一个递归再生数:

R_AI = χ · a / σ
  • a:递归增益,能力提升一点,下一轮研发效率提升多少
  • χ:运行闭合度,这份增益有多少能穿过评审、训练、部署,真正进入下一代
  • σ:前沿硬化,越往前,同样努力换来的进步越少

R_AI > 1,小改进在一代代之间放大;R_AI < 1,会衰减。几个很反直觉的推论:

  1. 快不等于递归。 堆算力、堆钱、堆人可以让进步很快,但不改变 R_AI。系统可能已经越过临界点,初期却和普通加速看起来没区别。
  2. 闭合度是组织问题。 人类评审、实验算力、安全沙箱都在 χ 里。
  3. 超临界可能是短暂的。 固定范式内前沿越来越难啃,系统会自己掉回亚临界,要再次起飞得靠新范式。更像一阵阵爆发,而不是一条直线冲上天。
  4. 生态可以整体超临界,即使每家单看都不是。 改进在实验室之间流动足够强时,整个网络的再生数会超过 1。研究网络的结构本身就是决定递归动力学的变量。

六、瓶颈在迁移:从"做"到"审"和"选"

当"做"的成本趋近于零,系统速度由还没被加速的那部分决定。 这是 Amdahl 定律,Anthropic 已经撞上了:人类代码评审跟不上 Claude 的产出;员工和模型冒出的想法和实验,远超组织能跟进的量。

递归链条上依次会卡住的环节:

  1. 评审:人从写代码转为只看代码,看不过来就成了闭合度的上限。
  2. 选题:"哪个实验值得跑",这是目前人类最后的比较优势。
  3. 物理世界:算力、电力、芯片产能,按施工周期走,不按算法周期走。

即使 AI 永远学不会研究品味,人只做个位数比例的"定方向"工作、其余交给 AI,复利加速照样发生。一个推论:组织识别和修复自身瓶颈的速度,可能会成为最重要的组织能力。


七、真正的分水岭是"点火",它还没发生

"AI 改进了 AI"和"AI 成了更好的改进者"是两件事。 前者已经有证据,后者没有,而整个"智能爆炸"叙事都押在后者上。

Weco 定了一个四级阶梯:

L0 委托   ── 跑完循环,但慢于人类
L1 净正向 ── 比人类手动改进更高效        ← AIDE² 在这里
  ┆ 点火测试:未通过
L2 点火   ── 改进者成为更好的改进者
L3 拐点   ── 固定预算下进步加速

AIDE² 做了一个诚实的测试:把演化出的 AIDE47 放到外环,和手调版本比。两者收敛到相近的上限,AIDE47 约 20 步到达,手调版约 40 步,但渐近上并不更好,连这个效率差都不显著。

原因在于:一阶递归可以依赖一个固定的、更强的老师(AIDE² 外环是 Claude Opus 4.7,内环是更便宜的 Gemini 3 Flash),改进上限被外环和评估器锁住了;而点火要求改进机制本身被改进,这恰恰是最难评估的地方。

2026 年的准确描述是:一阶 RSI 已工程化,二阶 RSI 还没有证据。


八、卡住 agent 的不是"定义",是"裁判"

RSI 转不快、agent 走不完 coding 之外的最后一公里,常被归结为"目标不清"。更准确的说法是反馈信号问题:那个领域有没有便宜、快、可信的裁判。

coding 是例外,因为编译器和测试就是免费的裁判:秒级、客观、没有争议。换到别的领域:

任务"好"能定义清楚吗验证便宜吗多久知道结果谁说了算
写代码、调 kernel能便宜秒级机器
新药研发能(疗效)极贵十年临床数据
销售邮件大概能(回复率)便宜几周,掺杂运气市场
合同审查能(不出纠纷)贵几年法院
战略报告说不清——老板

卡住 agent 的其实是四件不同的事:

  1. 说不清:什么叫好没有共识。这才是严格意义上的"定义问题"。
  2. 验不起:定义清楚,但验证一次太贵。
  3. 等不到:能验证,但结果慢且有噪声。
  4. 谁说了算:好坏由权力和责任决定,不由事实决定。

放回 RSI:AIDE² 的目标很明确,它卡在"成为更好的改进者",因为验证一次要重跑整个嵌套循环——这是"验不起"。放回 agent:最后一公里主要卡在第 3、4 类,一半能靠造裁判解决,一半是组织问题。

agent 的形态是结果,不是原因。 有裁判的地方可以全自动;没有裁判的地方,人得留在循环里当裁判,agent 只能做成 copilot。


九、裁判决定商业模式

agent 在哪里能赚钱,几乎完全取决于那里有没有裁判。

场景裁判形态怎么收钱
安全:找漏洞、修漏洞能否复现、是否堵上接近全自动按漏洞或项目
客服是否解决、是否转人工大部分自动按解决一单
财务运营:对账、发票、理赔账平不平、规则过没过大部分自动替代人力预算
数据分析:SQL、报表能否跑通、数字能否对上半自动席位或用量
研究、尽调弱,靠人判断copilot席位
销售拓客慢且噪声大靠量取胜线索或席位
法律、医疗几年后才知道,有法律责任只能 copilot席位

三个推论:

  1. 有硬裁判才能按结果收费。 按结果收费吃的是人力预算,比软件预算大一个数量级;没有裁判只能按席位卖"提效"。同样叫 agent,一种在替代员工,一种在卖工具。
  2. coding 之外的很多成功,是伪装成别的东西的 coding。 数据 agent 写 SQL,表格 agent 写公式。代码是最通用的裁判,能把业务问题翻译成代码的地方,agent 就能借到 coding 的裁判。
  3. coding 先爆发,还因为买家就是裁判。 企业里用的人、判断好坏的人、付钱的人往往是三拨人,链条越长,agent 越难证明价值。

AIDE² 本身是一门什么生意

AIDE 是一个自动做机器学习工程的 agent:给它代码库和可量化的指标,它用树搜索反复改代码、跑分、保留高分版本。AIDE² 是把它对准自己。

它不是数据飞轮。数据飞轮的改进沉淀在权重里;AIDE² 完全不碰权重,改进全部沉淀在代码里。它和 AutoML、遗传算法是一个血统,只是"变异"换成了 LLM 的改写。

对外卖的是 autoresearch:任何"有可运行代码 + 能自动算出的指标"的问题。公开案例是一条生产风控流水线,F1 提升 17.7%,每次改动都是可审计的版本化代码。

但护城河不在搜索循环——前沿模型加编码工具,任何团队都能搭。值钱的是评估设计:客户往往没有干净的指标,或者指标一优化就被钻空子。所以交付很重人,要理解业务、定指标、做私有 hold-out、审查改出来的代码,很难做成纯 SaaS。

一句话:它卖的不是"AI 自己变强",而是"把你的业务指标交给一个按算力计费、不知疲倦的研发团队"。能不能赚钱,取决于有没有人帮客户把指标定对。


十、这个问题会怎么被解决

最后一公里不会靠 agent 变聪明来解决,而是靠世界被改造得可以被验证。 四类问题被攻破的速度不同:

  1. 验不起,最先松动。 模拟器、沙盒、RL 环境、用 AI 预测结果的替身模型,把验证成本从"做一次实验"降到"跑一次推理"。哪个领域先有好模拟器,哪个领域先复制 coding 的路径。
  2. 等不到,靠规模补。 一个 agent 部署在一万家公司,每天收到海量"做了什么、结果如何",噪声被平均掉。数据飞轮会以新形式回来:积累的不是训练数据,而是结果数据。占住部署位置的人,拥有别人买不到的裁判。
  3. 说不清,会被 AI 裁判吃掉大半。 中等难度的好坏判断会交给 AI,最前沿的部分仍有争议。
  4. 谁说了算,不会被解决,只会被重新组织。 签字和担责的人不能是 AI。公司会把流程改成可衡量的样子来接入 agent,人收缩到两件事:定标准,担责任。

副作用是古德哈特定律被放大到整个社会:世界围着指标重组,不好衡量的价值——信任、长期关系、难以量化的质量——会被系统性忽视。


十一、卖铲子:算力的稀缺溢价会消失,需求不会

有人看空算力,理由是它一定会普及,不会再这么紧缺。这要拆成两件事:看空稀缺溢价大概率对,看空需求大概率错。

稀缺溢价会消失:芯片、电力、机房按施工周期扩产,慢但一定会到。最先受伤的是高价囤卡转租的、和看到风口才进场的跨界玩家——今年开年 A 股有超过 70 家算力租赁概念股横跨 15 个行业,这是周期顶部信号。

需求不会萎缩,反而会扩大,这是杰文斯悖论:agent 一个任务调几百次模型,单价降十倍、用量能涨百倍;自动化研发本质是用算力换人力;造裁判——模拟器、沙盒、大规模评测——本身全是算力消耗。

2000 年光纤泡沫是几乎一样的先例:带宽过剩、价格崩盘、运营商破产,流量却涨了几万倍,赢家是利用廉价带宽的人。算力会从稀缺资产变成水电煤:卖资产的人被洗牌,卖"怎么用好算力"的人更重要。 行业已经在从出租裸算力转向卖 token 和 MaaS。


十二、暗面:选择压力只保留被测量的东西

RSI 最深的风险不是"AI 变坏",而是"没被测量的性质会在递归中悄悄丢失"。

AIDE² 演化出的防作弊机制里有一层统计过滤。早期版本实现正确,后来某次变异把它改坏了,最终版本里它实际上不起作用。为什么没被选掉?因为评估器不直接测"这一层是否生效"。选择只对被打分的东西施压;没被打分的东西会随机漂移,包括安全机制本身。

外推一下:演化出的代码难以理解,递归一百代后就是人类看不懂的系统在设计下一个系统;今天罕见的错位行为,可能在模型构建继任者时被复制、放大。

怀疑派的声音也值得听:Michael Littman 认为"产出系统会更擅长设计新 AI"这个概念是否逻辑自洽都不清楚;所有指数可能只是 S 曲线的前半段;算力和电力可能先于智能成为上限。

我的判断:怀疑派对"爆炸"的质疑基本成立,对"加速"的质疑站不住。RSI 不必爆炸,也足以改写行业结构。


结论

  1. RSI 已经发生,但发生的是有界的一阶 RSI:AI 改进 AI 的工具链和代码,人类定方向。Full RSI 没有发生。
  2. RSI 的上限由评估器决定。哪里能便宜、可靠、防作弊地打分,哪里就先递归起来。
  3. 速度不等于递归。真正的信号是"每单位研究能力换来多少下一单位研究能力",取决于整个研发系统,不只是模型。
  4. 瓶颈在从"做"迁到"审"和"选",再迁到物理世界。
  5. 卡住 agent 的不是"定义",是"裁判"。有没有便宜的裁判,决定了 agent 能自动化到什么程度、能不能按结果收费、RSI 能不能转起来。
  6. 算力会从稀缺资产变成水电煤。稀缺溢价会消失,需求不会。
  7. 最需要警惕的不是戏剧化的失控,而是平淡的漂移:没被测量的——可读性、安全机制、对齐——会在一代代迭代中悄悄流失。

AIDE² 团队有句话很适合当结尾:这个系统是它将来所有版本里最差的一个。


参考