C
发布于 2026/09/03 · 阅读 2

当AI构建自身:递归自我改进的进展

  • #AI自我改进
  • #递归自我改进
  • #Anthropic
  • #AI开发
  • #代码自动化
当AI构建自身:递归自我改进的进展

当 AI 构建自身:递归自我改进的进展及其影响

在 AI 历史的大部分时间里,人类推动了其开发周期的每一步。但在 Anthropic,我们正将越来越多的 AI 开发工作委托给 AI 系统本身,这加速了我们的工作。

如果这一趋势延续下去,并配备足够的计算资源,最终将指向一个能够完全自主设计和开发继任者的 AI 系统。这被称为递归自我改进。我们尚未达到这一阶段,递归自我改进也并非不可避免,但它可能比大多数机构准备的要来得更早。

利用公开基准测试和 Anthropic 内部此前未公开的数据,Anthropic Institute 表明 AI 已经在加速 AI 系统的开发。仅举一例:如今,Anthropic 工程师每季度合并的代码量是 2021-2025 年平均水平的 8 倍。

本文讨论的技术趋势表明,AI 系统在未来几年将变得更加强大。这些趋势具有重大影响。能够自我构建的 AI 将是技术史上的重大发展——可能为科学、医疗等领域带来巨大益处。但完全的递归自我改进也可能增加人类失去对 AI 系统控制的风险。如果系统能够完全构建自己的继任者,那么保障其安全、监控其行为以及塑造其行为的方式都将变得更加重要。

2021–2023:构建第一个 Claude 早期,Anthropic 的工作与其他科技公司无异:人们在笔记本电脑上编写代码和文档。

2023–2025:聊天机器人 人们使用早期聊天机器人协助部分流程,如生成简短代码片段并将输出复制到文本编辑器中。

2025–2026:编码代理 随着代理变得更强大,它们能够自主编写和编辑代码,有时甚至是整个文件。

今天:自主代理 代理现在可以自己运行代码,并将数小时的工作委托给其他代理。

20XX?:闭环 未来,代理可能变得足够强大,能够自己构建和训练模型。如果发生这种情况,未来的 Claude 版本可能会由 Claude 自身持续改进。

来自外部世界的证据

AI 模型改进的速度正在加快。它们能够独立可靠完成的任务时长大约每四个月翻一番,而此前趋势是每七个月翻一番。2024 年 3 月,Claude Opus 3 能够完成人类大约需要四分钟的软件任务。一年后,Claude Sonnet 3.7 完成了约一个半小时的任务。又过了一年,Claude Opus 4.6 完成了 12 小时的任务。如果这一趋势持续,今年内就可能实现需要熟练人员数天才能完成的任务。到 2027 年,AI 系统可能能够完成需要人类数周的任务。

同样的模式也出现在编码和研究基准测试中。基准测试衡量模型在特定领域内的表现,当模型达到接近 100% 性能时即为“饱和”。SWE-bench 是真实世界软件工程的标准测试:它向模型提供一个实际的开源代码库和一个真实的 bug 报告,要求其编写一个代码修改来修复问题并通过项目自身的测试。模型在两年内从个位数得分上升到饱和该基准。

CORE-Bench 测试模型是否能复现现有研究,这是进行原创研究的先决条件。它向 AI 模型提供已发表论文背后的代码和数据,要求其重新运行所有内容并确认能否复现论文结果。AI 系统从 2024 年约 20% 的复现成功率,在 15 个月后达到基准饱和。运行衡量模型完成长时间任务能力的 METR 基准发现,Claude Mythos Preview 可以工作“至少”16 小时,并且“处于 METR 无需新任务即可测量的上限”。

公共基准测试说明了这些系统的大量能力,但它们无法揭示 AI 系统在加速 AI 开发本身方面的影响。为此,我们需要来自像 Anthropic 这样的 AI 公司内部的直接证据。

来自 Anthropic 内部的证据

构建前沿模型需要两大类工作。工程方面:编写代码、搭建基础设施和监督模型训练。研究方面:决定运行哪些实验、解释返回结果以及确定下一步尝试哪些想法。

在工程和研究两方面,情况是一致的。在工程方面,Claude 可以接受一个未完全明确的问题并找出解决方案;人类提供目标,但不再需要提供方法。在研究方面,Claude 在执行明确指定的实验时已经能够与熟练人类匹敌或超越。然而,在 Claude 需要运用判断力选择工程和研究目标时,仍然存在巨大的性能差距。这就是当今 AI 与未来能够自主设计继任者的系统之间的差距。

Anthropic 的员工通常会随着经验的积累而获得更开放和重要的任务。早期,他们执行别人指定的任务,例如“导出按钮坏了,请修复”。有了经验后,他们被赋予目标并自行设计方法,例如“调查网络在重负载下变慢的原因”。在最资深的级别,他们决定哪些问题值得研究:“团队下季度应该构建什么?”我们可以利用 Anthropic 内部数据来了解 Claude 在处理这些不同类型任务方面取得了多大进展。

Claude 编写了 Anthropic 很大一部分代码。截至 2026 年 5 月,我们合并到 Anthropic 代码库中的代码超过 80% 由 Claude 编写。在 2025 年 2 月 Claude Code 作为研究预览版发布之前,这一数字仅为个位数。这种转变也体现在每位工程师的输出量上。每位工程师每天合并的代码行数在 Anthropic 的前四年(2021-2024)保持稳定,然后在 2025 年 Claude 开始实际运行代码(而不仅仅是建议工程师复制粘贴)时开始攀升。2026 年,当模型开始在更长的时间范围内自主工作时,曲线再次陡峭。这两个拐点如下所示。2026 年第二季度,典型工程师每天合并的代码量是 2024 年的 8 倍。这是因为大部分代码由 Claude 编写,工程师负责指导和审查,而不是亲自输入。

一个警告:代码行数是一个不完美的衡量标准,因为它衡量数量而非质量。因此,2026 年第二季度代码行数/工程师/天达到 8 倍几乎肯定夸大了真正的生产力提升。尽管如此,它表明了加速。在 Anthropic,我们不会根据代码行数奖励员工;团队成员之所以产生更多代码,仅仅是因为他们使用 AI 系统编写更多代码。

代码行数的增加与主观感受的大幅生产力提升相符。在 2026 年 3 月对来自 Anthropic 研究团队的 130 名员工的调查中,中位受访者估计,在无论是否使用 AI 模型都会进行的同一类项目上,使用 Mythos Preview 的产出大约是未使用任何 AI 模型时的 4 倍。我们预计 3 月份的真实提升幅度可能略低一些。尽管如此,我们认为这一总体说法是合理的,并且与我们其他观察结果一致:Anthropic 技术人员的很大一部分正在以比没有 AI 辅助时快数倍的速度完成核心工作。

我们还看到证据表明,Anthropic 的员工正在使用 Claude 完成原本不会发生的工作,例如构建探索性工具和处理长期积压的清理工作。例如,2026 年 4 月,Claude 交付了超过 800 项修复,将一类 API 错误减少了 1000 倍。监督 Claude 的工程师估计,人类需要四年才能完成这项工作;解决其他人的 bug 既缓慢又费力,而且人类难以同时记住大量不熟悉的上下文。

“大约一年前,我开始大力推行 ‘Claudification’。这是一段疯狂的冒险,我自己已经大约 5 个月没有写过任何代码了。” ——Anthropic 员工

Claude 编写的代码是“好的”并且还在改进。“好代码”意味着两件事:它能工作,并且编写方式能让其他工程师理解并在此基础上进行构建。关于第一个标准,证据是清晰的。Anthropic 员工纠正、重定向或中途接管 Claude 任务的频率已持续下降一年,即使是最复杂和开放式的任务也是如此。这意味着那些没有明确规范、工程师不确定答案是什么的问题。下面的图表显示了 Claude 在不同难度任务上随时间变化的成功率。Claude 编写的代码是能工作的。

如何解读:会话成功由 Claude 评审者判定;如果 Claude Code 代理明显成功完成了用户的任务且无需更正,则该会话被视为成功。工作负载的变化可能导致成功率的短期波动。

在最开放式的任务中,Claude 的成功率在 2026 年 5 月达到 76%,六个月内提高了 50 个百分点。举个例子:一次例行升级导致数万个训练作业崩溃。一名工程师将 Claude 指向实时事件,仅提供了少量文本内容和集群访问权限。通过逐一检查运行中的作业并测试环境设置,Claude 隔离了触发崩溃的一个晦涩的调试标志,可靠地重现了问题,并确认了修复方案。大约两小时内,Claude 完成了通常需要两到三天的工作。

第二个标准是编写其他工程师能理解和构建的代码。在这方面,人类与 AI 之间的差距仍然存在,但正在迅速缩小。Anthropic 员工之间尚未达成完全共识,但许多人认为 Claude 编写的代码在 2025 年末质量仍低于人类编写的代码,而如今大致持平。我们预计一年内它将优于人类。

这改变了 Anthropic 现在审查自身代码的方式。对代码库的更改建议现在由自动化的 Claude 审查者读取,在合并前寻找 bug、安全漏洞和其他缺陷。使用这一工具,我们进行了一项回顾性分析,发现如果对代码库的每次更改都进行自动化的 Claude 审查,那么 claude.ai 上过去事件中大约三分之一的 bug 在进入生产环境之前就会被发现。编写那些代码的工程师是世界顶尖的系统构建者。Claude 现在正在捕捉他们漏掉的错误。

“Claude 编写的代码在 2025 年末略逊于人类编写的代码,如今大致持平,我们预计一年内将严格优于人类。”

Claude 擅长运行实验以达到别人设定的目标。每次 Anthropic 发布模型时,我们都会运行相同的测试:我们给 Claude 一些训练小型 AI 模型的代码,并要求它尽可能快地运行该代码,同时仍然通过相同的正确性检查。目标和成功指标是预先确定的,因此 Claude 的工作是通过重写代码、运行、计时、重复来寻找加速方法。这是一个微型实验研究循环。2025 年 5 月,Claude Opus 4 平均实现了约 3 倍的加速……

2 阅读0 评论0 点赞

评论

登录 / 注册即可发布评论!
暂无评论,成为第一个发表评论的用户吧。