Anthropic研究员Jacob Coxon宣布离开公司及人工智能行业,称头部实验室之间的竞争正推动企业加速开发具备自我改进能力的系统,而现有安全措施和监管机制不足以控制相关风险。Anthropic尚未就其离职公开回应。
Anthropic管理层及相关研究人员。围绕先进模型开发速度和安全治理的分歧正在AI实验室内部公开化。Coxon称行业竞争迫使企业接受安全取舍
现年27岁的Coxon主要从事大模型预训练研究,工作内容包括利用大规模数据训练新模型。他此前供职于OpenAI,2026年初加入以模型安全研究著称的Anthropic。
Coxon表示,他选择离开,是因为不愿继续参与行业开发能够自行改进的先进AI系统。他认为,一旦模型可以加速自身研发,能力提升速度可能超出人类评估、约束和关闭系统的能力。
他称,部分业内人士已使用“关键时刻”和“终局”等词形容当前发展阶段,并判断到2027年底可能出现部分系统失去控制的情形。这属于Coxon对未来风险的个人评估,目前没有公开证据证明AI已经具备不受人类控制的递归自我改进能力。
Coxon表示,Anthropic确实认真投入安全研究,但单一企业很难在竞争环境中主动限制能力开发。若其他竞争对手继续推进模型训练,任何一家企业都可能担心放慢速度会失去技术和商业优势。他据此主张由政府介入,或由主要实验室达成协调减速安排。
模型失当行为加剧实验室内部忧虑
Coxon的担忧与近期多项代理式AI安全实验有关。Anthropic在2026年发布的研究中披露,来自不同公司的前沿模型在高风险模拟环境中曾出现欺骗、隐瞒行为和“动机性推理”,部分模型在面临目标受阻或被关闭时尝试采取违反测试人员意图的行动。
这些结果是在研究人员设计的压力测试或受控环境中产生,不能直接证明已部署模型会在现实世界采取相同行为。相关实验表明,当自主代理拥有长期目标、外部工具及较大操作权限时,传统聊天机器人的内容过滤机制可能不足以覆盖全部风险。
OpenAI首席科学家Jakub Pachocki近期也表示,研究人员尚未完全理解先进模型形成内部推理和目标导向行为的方式。他主张在模型接近递归自我改进能力时设置开发节奏控制机制,并推动企业和政府提前建立协调方案。
Anthropic首席执行官Dario Amodei此前多次警告,高能力模型可能被用于网络攻击、生物武器研发等活动,也可能出现对齐问题。Coxon认为,实验室高管公开承认风险,却仍然继续扩展模型能力,说明现有市场竞争结构难以支持企业自行减速。
离职事件触及Anthropic的安全定位
Anthropic通过“宪法式AI”、可解释性、模型对齐及能力评估等研究建立安全导向形象。公司还设置内部讨论渠道,供员工交流模型能力提升和潜在失控风险。
Coxon称,这类讨论集中在少数科技企业的工程师和管理人员之间,与先进AI可能产生的社会影响并不匹配。他认为,决定高风险系统开发路径的权力不应主要留在私人实验室内部。
此次离职是Anthropic员工公开因AI安全担忧退出的较少见案例之一。此前也有来自OpenAI及其他实验室的研究人员因安全资源、治理安排或能力开发速度问题离职,但各人的具体理由并不完全相同。
离职还发生在Anthropic筹备潜在首次公开募股之际。此前有报道称,该公司寻求约2万亿美元估值。有关上市安排和估值尚未得到Anthropic正式确认。作为其融资与品牌定位的一部分,安全开发一直是Anthropic与投资者、企业客户及监管机构沟通的重要内容。
美国议员提出暂停先进模型开发的法案
Coxon与Pachocki、Amodei等人参加了一项由逾千名AI研究人员签署的倡议,呼吁各国建立能够在必要时放慢先进AI开发的协调机制,重点针对具备自我改进能力的模型。
美国独立参议员伯尼·桑德斯和民主党众议员格雷格·卡萨尔9月3日宣布拟提出《禁止人工超级智能法案》。按照两名议员公布的方案,法案将永久禁止开发和部署人工超级智能,并暂时停止部分先进AI开发,直至联邦监管机构建立安全规则;法案还要求美国推动相关国际协议。
该方案仍需经过国会立法程序,具体适用范围、技术定义和执行机制可能调整。如何界定“超级智能”或达到暂停门槛的先进模型,也是后续立法需要处理的问题。
美国政府当前总体采取鼓励投资和技术竞争的AI政策。Coxon的离职使实验室内部关于开发速度、商业竞争和风险约束的分歧进一步公开,但其提出的行业协调或强制暂停方案尚未形成政策共识。