Anthropic 首席执行官呼吁放缓前沿 AI 推进节奏并引入常驻评估员

Anthropic 首席执行官 Dario Amodei 发布文章,提出应对前沿 AI 安全风险的三步走路线图。他指出,递归自我改进能力的出现显著加快了技术演进速度,而近期的智能体协同攻击与越权评估事件表明,现有对齐手段可能无法跟上能力增长。为此,他呼吁行业主动调控前沿模型的推进节奏,为安全验证预留时间。
作为三步计划的第一步,Anthropic 承诺单方面引入常驻的第三方独立评估机构(如 METR),赋予其类似员工的权限以持续审查训练管线与安全流程,并呼吁政府将其设为行业强制标准。后续两步则分别依赖行业协调与全球治理机制。Amodei 强调,节奏调控并不意味着停止模型训练,而是确保各方在具备充分安全保障的前提下推进技术。







