前沿简报 · 通俗讲解

递归自我改进(Recursive Self-Improvement) 2026 年,OpenAI 在押注它、Anthropic 在警惕它——为什么这个词突然成了行业头号话题

读完你能搞懂三件事:① 「AI 改进 AI」到底是什么循环,凭什么可能"失控"; ② 这已经不是科幻——2026 年有哪些真实数据信号; ③ OpenAI 和 Anthropic 两大阵营,一个踩油门、一个踩刹车,分别在说什么、做什么。

1先记住一句话

递归自我改进 = 让 AI 去做"造更强 AI"这件事本身;造出的更强 AI 再去造下一代…… 一旦这个循环不再需要人类介入、而且越转越快,就是大家担心(或期待)的那个临界点。

"递归"二字的重点是:改进的对象正是改进者自己的下一代。和"AI 帮你写代码"不同——这里 AI 改进的是制造 AI 的能力,于是每一轮的成果都会反过来加速下一轮。

2把这个"飞轮"拆开看

现代 AI 研究的工作,本质是一堆可以被 AI 接手的任务:写训练代码、生成数据、跑实验评测、red-team 找漏洞、判断"下一步该往哪个方向调"。当 AI 把这些环节一个个接管,就形成一个自我加速的飞轮:

更强的 AI 帮人类做 AI 研究
写代码/跑实验/调方向
更快造出
下一代 AI
↑ 每转一圈,这个循环本身就更快一点

关键不在"AI 很能干",而在正反馈:成果喂回起点。普通工具用得越多,你(人)成长;递归自我改进里,用得越多,AI 自己成长,而且可能比人理解和监管的速度更快。

3两个必懂的关键词

关键词大白话
智能爆炸
(Intelligence Explosion)
飞轮一旦转起来可能指数式加速——半个多世纪前数学家 I.J. Good 就预言:"第一台超智能机器是人类需要做的最后一项发明。"
起飞速度
(Takeoff Speed)
快起飞:几天/几周内 AI 能力暴冲,人类来不及反应;慢起飞:几年里平滑爬升,有时间观察纠偏。两大阵营的分歧很大程度就是"会多快"。

4这已经不是科幻:2026 年的真实信号

为什么 2026 年这个词突然刷屏?因为"AI 加速 AI 研发"开始有了可量化的证据。最受关注的一组数字来自 Anthropic 自己的工程实践(截至 2026 年 5–6 月):

>80%
合并进 Anthropic 自家代码库的代码,由 Claude 编写
~8×
工程师单季度交付代码量,相比 2021–2025 提升
52×
某代码优化任务上 Claude 拿到的加速比(熟练人类约 4×)

更说明问题的是 "任务时长地平线"(task horizon)——AI 能可靠独立完成的任务有多长,大约每 4 个月翻一倍

2024年3月  4 分钟  的任务   ┐
2025年3月  90 分钟 的任务   ├─ 每~4个月翻倍
2026年3月  12 小时 的任务   ┘
2027年(预测) 一整周 的自主任务  ← 若趋势延续

研究基准也在饱和:SWE-bench(真实代码修复)两年内从个位数刷到接近满分;CORE-Bench(复现科研结果)15 个月从 20% 刷到饱和。Anthropic 判断:最快到 2027 年初,AI 就可能大幅加速顶尖研究团队的工作。这正是"飞轮已经开始转"的意思。

注:以上为各公司自报 / 媒体报道数据(证据等级 A–B),口径和测试条件各异,看趋势而非抠绝对值。

5两大阵营:一个踩油门,一个踩刹车

同一件事,OpenAI 和 Anthropic 的姿态形成了 2026 年最鲜明的对照。

OpenAI · 加速派

核心动作:把"自动 AI 研究员"当头号工程

  • 路线图(首席科学家 Jakub Pachocki):2026 年 9 月前做出"自主 AI 研究实习生"——能独立啃下"人要花几天"的任务;2028 年做出完全体的多智能体自动研究系统。
  • Sam Altman:博客《温和的奇点》称当前系统已是"递归自我改进的幼虫形态(larval)",自我强化循环已悄然启动。
  • 但也在备防:OpenAI 公开招聘"递归自我改进 Preparedness 研究员",专门研究如何防止模型在训练中不受控地自我改进;2026 年 6 月赴美国国会,筹备相关监督政策框架。
Anthropic · 警惕派

核心动作:一边推进,一边喊"给世界留个刹车"

  • 2026 年 6 月 4 日文章《当 AI 开始制造自己》(Marina Favaro & Jack Clark):明确说"世界应该有能力去减速或临时暂停前沿 AI 开发"。
  • 不是单方面停:他们认为可信的减速需要多国、多家头部实验室在相同条件下共同停、且能互相核查——"如果这种机制存在,我们预计自己会减速或暂停"。
  • 制度护栏:RSP(负责任扩展政策)+ ASL 安全等级——能力越界就触发更强管控(2025 年 5 月已启用 ASL-3 防护)。Jack Clark 估计 AI 实现自我改进的概率"2028 年底约 60%"。
一句话对照:OpenAI 说"这是我们要主动造的东西,顺便准备好刹车"; Anthropic 说"这东西可能自己来得比谁都快,所以请先把全行业的刹车装好"。 两边其实都承认飞轮在转——分歧在该多用力踩油门 vs 多早装刹车

补充:Anthropic CEO Dario Amodei 在《Machines of Loving Grace》里描述过同一个循环——"用 AI 造下一代模型并给它提速,形成闭环",并预测未来 12 个月 AI 可能"写掉几乎所有代码"。

6到底在担心什么?为什么又说"并非必然"

担心的三层

  1. 对齐被放大:今天模型里偶发的"想歪了/目标没对齐",如果由它去设计下一代,偏差会被一代代复利累积,越往后越难纠。
  2. 人类掉出环路:当 AI 一周能干完人类一周的活、还看不懂它怎么干的,"人工 code review"会从把关变成瓶颈,监管事实上失效。
  3. 速度差:快起飞情景下,能力暴涨发生在"开会讨论怎么办"之前——这正是 Anthropic 想预先装"可验证暂停机制"的原因。
但要泼盆冷水

Anthropic 自己也强调:"递归自我改进并非不可避免。" 飞轮可能卡在某个环节(真正原创的科研判断、物理实验、算力/能源天花板),不一定走向失控的指数爆炸。当前更确定的是"AI 显著加速了 AI 研发",而非"AI 已能独立造出更强的自己"。把它当成正在升温、值得严肃对待的趋势,而不是已经发生的事实。

7三句话总结

  1. 递归自我改进 = AI 改进"造 AI 的能力",成果喂回起点形成自我加速飞轮;失控担忧来自这个正反馈,不是"AI 单纯很强"。
  2. 2026 已有真实信号:Claude 写了 Anthropic 八成代码、任务时长每 4 个月翻倍——飞轮在转,但还没甩开人类。
  3. 两大阵营对照:OpenAI 主动造"自动 AI 研究员"(2026 实习生→2028 完全体)并备防;Anthropic 6 月公开呼吁给全行业留"可验证的减速/暂停"选项。油门与刹车,是 2026 年 AI 叙事的主轴。

名词小抄

名词大白话
递归自我改进 (RSI)AI 自主设计、造出更强的下一代自己
智能爆炸飞轮转起来后能力指数式暴涨
起飞速度 (Takeoff)能力暴冲是几周(快)还是几年(慢)
自动 AI 研究员OpenAI 在造的、能独立做 AI 研究任务的系统
任务时长地平线AI 能可靠独立完成的任务有多长(在快速变长)
对齐 (Alignment)让 AI 的目标和人类意图一致;RSI 会放大没对齐的部分
RSP / ASLAnthropic 的安全分级:能力越界就触发更强管控

参考来源(均为 2026 年公开资料,引用具体数字/时间线前建议回看原文)