Chengshuo Dai
Back to Blog

Recursive Self-Improvement in AI:递归自我改进到底是什么?

AI SafetyAgent

讨论下 Anthropic 关于 RSI,也就是 Recursive Self-Improvement 的研究。 RSI 指的是:AI 系统开始参与改进 AI 系统本身,包括改进自己或改进下一代 AI。关键点不只是"AI 帮人写代码",而是每一轮改进都会让下一轮改进变得更快、更有效,形成一种复利式循环。

核心定义:递归自我改进不是一个单一状态,而是一条连续谱。

  • 最轻的一端是 AI 辅助研究。比如 Claude 帮 researchers 写实验代码、总结论文、调参、分析训练结果,但最终决策仍由人类完成。
  • 中间状态是 AI 承担更大比例的研究循环。比如 AI 自己提出实验方案、运行实验、分析结果、建议下一步训练方向。人类仍然在关键节点审核,但不再逐步盯着每个动作。
  • 最极端的一端是完全自主 RSI。AI 能自己发现能力瓶颈、设计架构改进、修改训练流程、设计评估指标、验证结果,并继续迭代下一代系统。这个状态还不是现实,但 Anthropic 认为需要提前准备。

那为什么现在要讨论 RSI?

AI 能力进步具有压缩时间线的可能。

如果 AI 可以显著参与自身改进,那么从"人类还能管理"到"人类很难管理"的阶段,可能会来得很快。原因是 AI 改进 AI 不是线性加速,而可能是复利加速。每一代模型更强,又能更快地帮助开发下一代模型。所以 Anthropic 的思路是:安全研究不能等能力已经失控后再追赶,要提前研究监控、评估、暂停和干预机制。

Anthropic 提出三个场景

场景一:AI-assisted research

这是当前已经存在的状态。AI 是研究员的生产力工具。它可以写代码、读论文、生成实验脚本、分析训练日志,但人类仍然决定研究方向、实验是否有效、模型能否上线。

这个阶段的风险相对可控,但它会加速 AI 能力研究。如果安全研究速度跟不上能力研究速度,风险会逐渐积累。

场景二:Substantial AI contribution to AI development

这是近中期场景。AI 不只是辅助,而是开始承担研究循环中的大块任务。它可以提出假设、跑实验、评估结果、提出模型训练改动,而人类只在 checkpoint 审核。

这个状态的问题在于:人类还在 loop 里,但 loop 变快了。错误目标、错误评估指标、隐藏的偏差,可能在被人类发现前已经进入下一轮模型训练。

对做 Agent 项目来说,这对应的是"自主 Agent + eval + trace + human checkpoint"的工程问题。

场景三:Fully autonomous RSI

这是最极端的情况。AI 能几乎完整运行 AI 研发闭环:发现限制、设计改进、实现改进、验证改进、部署下一代模型。

这不是当下现实,但从场景二到场景三未必需要一次巨大突破。可能只需要 AI 在每个环节都稍微强一点,再配上更自动化的基础设施,就会让系统整体变成自主改进循环。

RSI 最大的安全问题是什么?

核心问题不是"AI 会不会突然变坏",而是人类监督能力可能跟不上 AI 迭代速度。

第一,速度超过监督。安全机制通常依赖人类评估模型行为、发现问题、修复问题,再发布下一版。如果 AI 迭代太快,人类评估的可能只是一个已经过时的快照。

第二,问题会复利放大。某一代模型里的小偏差、小目标错位、小评估漏洞,可能被下一代模型继承并放大。

第三,能力评估本身很难。我们现在就没有特别可靠的方法完整评估一个模型到底会什么。若模型还参与了自身设计,评估会更难。

所以 Anthropic 强调三个原则:保留人类监督能力、提前开发更强评估方法、必须具备减速或停止系统的能力。

Alignment 在 RSI 里为什么更难?

普通 alignment 问题是:如何让当前模型符合人类意图。

RSI 里的 alignment 问题更难:不只要让当前模型对齐,还要保证它参与训练或改进出的下一代模型也保持对齐。

也就是说,对齐不能只是一次训练后的静态结果,要能穿过多轮自我改进循环。否则当前模型看起来安全,但它优化出来的下一代模型可能逐渐偏离人类真正关心的目标。

这也是 Anthropic 为什么重视 Constitutional AI 和模型安全研究:让模型在当前 benchmark 上表现安全,同时也让模型的价值约束在未来变化中仍然稳健。

和开发 Agent 项目的关系

RSI 这个概念对开发者最有用的地方,在于 RSI 背后的工程结构。

Agent 除了 task execution,还要有 trace、eval、checkpoint、rollback、monitoring。 未来的 Agent 项目会越来越像一个可控的自动化研究/执行系统。真正有价值的是让 Agent 在"更自主"的同时,让它仍然可观测、可评估、可干预。

RSI 的本质是 AI 参与改进 AI,并让改进过程形成复利循环。 AI 系统一旦进入自动化改进循环,风险就不只是单次输出错误,而是错误可能被持续放大。

对大多数开发者而言,RSI 更多是一种长期背景因素。 切实可行的建议是:顺应模型能力随时间不断提升的趋势去构建系统,在应用层投入监控与监督机制,针对高风险智能体决策设置人工复核节点,并持续关注基础模型能力的演进方向。