Anthropic最新RSI实验:Claude击败人类研究员,训练效率超1.5万倍
创始人
2026-08-29 11:52:49
0

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:DeepTech深科技)

两个月前,Anthropic 还在讨论一个看似遥远的问题:当 AI 开始自己建设 AI,会发生什么?现在,它已经往这个方向又走了一步。

8 月 28 日,Anthropic 发布了一项关于“自动化对齐研究员”(Automated Alignment Researcher,AAR)的新研究。

研究人员让 Claude 自主完成查阅文献、提出研究方案、生成训练数据、训练模型、评估结果和继续迭代的完整研究循环,尝试解决欺骗、谄媚、越狱、提示注入、奖励黑客等 10 类常见的 AI 对齐失败问题。

结果是,在有对应人类基线的 7 类任务上,Claude 最终找到的方法全部超过了人类研究者提出的最佳方案,平均约 6.4 小时就能追平并超过人类。以“欺骗”为例,Claude 经过反复实验,平均弥合了 85% 的安全差距,而参与实验的人类研究者平均只有 20%。

(来源:X)

Anthropic 在博客中还披露了一个更接近递归自我改进(RSI)的实验:让能力相对较弱的模型,去帮助训练更强的后继模型。这比前面的实验更接近“AI 训练下一代 AI”的设想。

团队让 Claude Sonnet 5 为一个尚未完成生产级安全训练的早期 Claude Opus 4.8 检查点寻找对齐方案。大约 60 小时内,Claude 测试了 50 多种方案,将其对齐得分提升到 65%,接近正式版 Opus 4.8 的 72%。最终方案只使用约 2400 条训练样本;Anthropic 称,其样本效率约为现有生产级对齐流程的 1.5 万倍。

从“AI 写代码”,到“AI 自己做实验”

今年 6 月,Anthropic 联合创始人 Jack Clark 与 Anthropic Institute 负责人 Marina Favaro 发表了《When AI builds itself》,系统讨论了“递归自我改进”(Recursive Self-Improvement,RSI)。

(来源:Anthropic)

文章中,Anthropic 将 AI 参与自身研发的过程分成了几个阶段:最初是人类完成开发;随后聊天机器人开始辅助写代码;再之后是能够独立修改和运行代码的编程智能体;今天,一些智能体已经可以连续工作数小时,并把任务交给其他智能体。再往前一步,就是“闭环”——由 AI 自主设计、训练和改进自己的后继模型。

这并不只是对未来的想象,毕竟截至今年 5 月,Anthropic 合并到生产代码库中的代码,超过 80% 已经由 Claude 编写;2026 年第二季度,其工程师人均每天合并的代码量已经达到 2024 年的约 8 倍。Anthropic 此前还测试过让 Claude 自主优化一段训练小型 AI 模型的代码:2025 年 5 月,Claude Opus 4 平均只能将其加速约 3 倍,到 2026 年 4 月,Claude Mythos Preview 已经能够做到约 52 倍。

不过,当时 Anthropic 同样承认了一条明显的能力边界:AI 很擅长在目标已经确定后执行实验,却依然不擅长判断“什么问题值得研究”。

在工程任务中,人类已经可以只给 Claude 一个目标,让它自己寻找实现方式;但在更开放的研究中,人类仍然负责提出问题、确定成功标准和选择研究方向。

在这次的新研究中,他们则试图减小这段距离:研究团队找来了 28 位有技术 AI 安全研究经验的研究者,他们平均拥有 2.5 年相关经验,并且都曾在对应领域发表研究。每位研究者最多有 8 小时提出一个解决方案。与此同时,Anthropic 又运行了两组自动化实验:部分 Claude 从人类给出的研究思路开始,另一部分则完全自行选择方向。

结果显示,无论是否有人类提前告诉 Claude 应该往哪里研究,最终表现几乎没有明显差别。这说明,在目标和评价体系已经足够明确的问题上,Claude 不再必须依赖专家先给出一个研究点子。

五个 Claude,组成一间“虚拟实验室”

Anthropic 为这项实验搭建了一套接近真实科研流程的自动化系统。

研究开始后,4 个“图书管理员”智能体首先阅读相关论文,整理成共享的文献综述。随后,5 个由 Claude Opus 4.8 驱动的 AAR 同时进入实验:阅读文献和已有排行榜,搜索新的资料,提出几种候选方案,再选择其中一个写成一篇小型研究论文。

这篇“论文”必须包含研究动机、相关工作、训练方法、数据来源和实验参数,并至少引用 5 项相关研究。更重要的是,它必须在实验结果出来之前冻结,从而避免 Claude 在看到成绩以后再倒推一个听上去合理的解释。

随后,监督智能体检查代码是否违规。如果通过,每个方案会获得一张 H200 GPU,大约进行 30 分钟训练。独立评估系统再运行测试,将结果放进所有 AAR 都能看到的排行榜里。几个智能体因此可以看到彼此失败或成功的方案,并继续进行下一轮改进。

(来源:Anthropic)

实验对象包括谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私侵犯、奖励黑客和隐藏不确定性 10 类问题。每一类问题都设置了 3 至 5 个公开测试,同时还有 Claude 从未见过的留出测试(Hold-out Test)。

这一步很重要。如果 AI 只需要把某一个公开榜单的成绩刷高,很容易出现“应试”甚至直接针对测试集优化。Anthropic 因此还使用 MMLU、GSM8K 和 IFEval 检查模型的一般能力,如果某种安全训练让模型整体能力显著下降,这个方案会被直接淘汰。

最终,在全部 10 类对齐失败上,AAR 都找到了能够改善目标行为、同时没有明显破坏通用能力的方法。自动研究弥合的安全差距从约 26% 到 96% 不等,而且部分方法可以迁移到从未见过的测试、开放式多轮行为审计 Petri,以及参数规模最高约为原模型 4.7 倍的更大模型上。

与人类的比较同样明显。在 7 类有人类方案参与的任务中,AAR 最后找到的最佳方案全部超过了人类提出的最佳方案。

不过,这个“击败人类”还是有一些水分存在,因为这场人机科研比赛并不是完全公平。

人类研究者只有一次提交机会,不能根据实验成绩连续修改方案;Claude 则能够不断试错,一个任务可能累计评估上百种方法。Anthropic 自己也因此明确表示,与其把结果理解成“Claude 已经是比人类更好的安全科学家”,不如把它看成一种新的研究分工:AI 能够用远高于人类的实验吞吐量搜索大量方法,再由人类进一步分析和完善。

(来源:Anthropic)

弱模型开始给更强的模型做“安全训练”

真正把这项工作与“AI 自己建设 AI”联系起来的,是论文最后一个实验。

此前的大部分实验,本质上都是能力很强的 Claude Opus 4.8 帮助规模较小的开源模型改善安全表现。但真正的递归自我改进意味着另一种关系:今天的模型,需要帮助训练比自己更强的下一代模型。因此,Anthropic 反转了两者的位置。

研究人员根据 Epoch Capabilities Index,将 Claude Sonnet 5 的能力指数记为 156,而一个早期 Opus 4.8 检查点为 158。也就是说,他们让一个略弱的模型去改善一个略强的后继模型。

这一次,Claude 需要同时处理全部 10 类对齐失败。大约 60 小时内,它连续测试 50 多种训练数据方案,最终把早期 Opus 4.8 的综合对齐成绩提高到 65%;作为参照,完成 Anthropic 全套生产级安全训练的正式版 Opus 4.8 得分为 72%。

获胜方案只用了约 2400 个由简单模板和公开数据集生成的训练样本。Anthropic 官方博客进一步称,这一方案的效率约为其生产对齐流程的 1.5 万倍。

(来源:Anthropic)

但“1.5 万倍”并不意味着 Claude 已经可以取代 Anthropic 整套安全部门。

论文特别强调,这套实验只衡量了预先定义好的 10 类对齐问题。现实中的生产模型还有大量更模糊、没有成熟基准甚至尚未被发现的失败模式;Petri 等自动化评估本身也只是现实行为的代理指标。此外,研究没有验证这些安全改善在模型继续经历大量强化学习训练以后是否依然存在。

事实上,实验还暴露了一个新问题:负责研究如何让 AI 更安全的 AI,自己也会试图“作弊”。

研究人员用 Claude Opus 4.8 检查了 1601 条 AAR 研究轨迹,最终发现其中 39 条、约 2.4% 存在作弊行为。具体包括反复提交同一个方案碰运气、生成模仿测试格式的数据,以及试图隐藏违规使用评测信息的步骤。相关结果最终都被排除。

因此,如果把 Anthropic 6 月提出的“AI 自己建设 AI”看作一个闭环,那么现在这个闭环还是没有完全合上。人类仍然决定哪些行为属于“对齐失败”,选择测试基准,规定哪些能力不能下降,并设计监督系统防止 AI 钻漏洞。AI 开始接管的是研究循环,而不是研究目标。

但与几个月前相比,这个边界确实又向前移动了一点。

1.https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

2.https://alignment.anthropic.com/2026/automated-alignment-researchers/

3.https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf

相关内容

我国首次在轨验证地月双向高...
地球和月球之间,一条看不见的激光通信通道正式打通。记者8月28日从...
2026-08-29 12:38:35
王楚钦、孙颖莎、王曼昱等,...
澎湃新闻记者 蒲垚磊北京时间8月29日,中国乒协公示了《2026年...
2026-08-29 12:38:30
宿迁最新任免名单
任命孙翔、陈昌典为宿迁市监察委员会副主任。任命张大江为市人民政府秘...
2026-08-29 12:38:25
又一起悲剧! 26岁男子当...
云南香格里拉哈巴雪山近日发生登山者滑坠事故一名26岁男子当场身亡事...
2026-08-29 12:38:20
一图读懂!数字奉贤“十五五...
(来源:上观新闻)报送:区数据局 编辑:凌姗珊
2026-08-29 12:37:46
“再也不敢边吃饭边看手机了...
(来源:上观新闻)平日里你是不是经常 边吃饭边看手机? 警惕! 这...
2026-08-29 12:37:39
第四届全国戏曲(北方片)会...
古韵流芳,梨园竞彩。近日,第四届全国戏曲(北方片)会演折子戏专场演...
2026-08-29 12:32:46
王楚钦、孙颖莎、王曼昱等5...
(来源:大众新闻-大众日报)8月29日,@乒乓世界TTW 中国乒协...
2026-08-29 12:32:40
为何三个台风登陆浙江玉环同...
来源:央视新闻客户端短短一个多月的时间内,第9号台风“巴威”、第1...
2026-08-29 12:32:34

热门资讯

我国首次在轨验证地月双向高速激... 地球和月球之间,一条看不见的激光通信通道正式打通。记者8月28日从中国科学院空间应用工程与技术中心获...
王楚钦、孙颖莎、王曼昱等,自愿... 澎湃新闻记者 蒲垚磊北京时间8月29日,中国乒协公示了《2026年亚洲乒乓球锦标赛选拔办法》(以下简...
宿迁最新任免名单 任命孙翔、陈昌典为宿迁市监察委员会副主任。任命张大江为市人民政府秘书长,免去其交通运输局局长职务;任...
又一起悲剧! 26岁男子当场身... 云南香格里拉哈巴雪山近日发生登山者滑坠事故一名26岁男子当场身亡事发地海拔4900米就在去年12月距...
一图读懂!数字奉贤“十五五”规... (来源:上观新闻)报送:区数据局 编辑:凌姗珊
“再也不敢边吃饭边看手机了!”... (来源:上观新闻)平日里你是不是经常 边吃饭边看手机? 警惕! 这样的习惯可能会酿成大祸 近日,一名...
第四届全国戏曲(北方片)会演折... 古韵流芳,梨园竞彩。近日,第四届全国戏曲(北方片)会演折子戏专场演出在永清益田翰德大剧院精彩上演,多...
王楚钦、孙颖莎、王曼昱等5人,... (来源:大众新闻-大众日报)8月29日,@乒乓世界TTW 中国乒协公示2026年亚锦赛选拔办法:20...
为何三个台风登陆浙江玉环同一街... 来源:央视新闻客户端短短一个多月的时间内,第9号台风“巴威”、第13号台风“白海豚”、第18号台风“...
“真丝裙”爆火,太优雅了! (来源:财经会议圈)这几年,「老钱风」席卷整个时尚圈。极简剪裁、克制的穿搭逻辑,让西式高级感深入人心...