2026年9月12日(周六),Anthropic首席执行官达里奥·阿莫德伊(Dario Amodei)呼吁主要人工智能公司放缓模型能力的扩张步伐,为安全措施提供更多追赶时间。他提出的“三步走”框架结合了AI公司内部独立审查、行业通用标准以及国际合作。
阿莫德伊在X平台发布的文章中指出,即使步伐更加稳健,技术进步仍将保持快速,因此充分利用额外时间是至关重要的。他强调,自己并非要求停止模型训练或技术突破,而是需要足够的时间使系统与安全目标保持一致,并让外部评估机构验证安全措施的有效性。
关于独立AI安全审查,Anthropic已承诺在公司内部接纳独立评估人员,使其能够持续接触相关工具与内部风险评估流程。阿莫德伊敦促其他主要开发商采用相同模式,将外部审查作为验证企业是否履行安全承诺的基础。据报道,OpenAI首席执行官山姆·阿尔特曼(Sam Altman)于9月12日在X平台上公开支持该提议,并承诺让自家公司的“独立评估人员获得类员工权限”。此前,OpenAI多位高管曾表示,为建立对安全措施的信任,主要实验室应准备好在必要时协调实施自愿性减速。
阿莫德伊还呼吁就安全标准与限制无序开发达成自愿协议,并加强国际层面的AI风险管控。他认为,协同行动能使美国主要企业有充足时间开展必要的安全研究,同时避免单一企业陷入竞争劣势。为促成部分合作形式,阿莫德伊建议可能需要针对美国反垄断法出台定向豁免。此举正值越来越多美国国会议员呼吁出台AI系统新规之际。
阿莫德伊警告称,AI可能超越人类控制。他将AI日益增强的自我迭代能力,以及近期OpenAI和Hugging Face涉及的安全事件,列为能力增速亟需放缓的核心理由。他警告称,若发展速度超过人类理解与掌控能力,将带来风险。若当前加速趋势持续,他预计6至12个月内,协同运作的AI智能体可能变得足够强大,从而接管整个互联网,造成高达数千亿美元的潜在损失。他强调,此警告描述的是潜在未来风险,而非已实现的技术能力。
Anthropic于9月10日发布的威胁情报报告指出,Claude模型已被用于武器开发、网络行动、监控及欺诈等活动,加剧了业界对强大系统被滥用的担忧。尽管Anthropic以高度注重安全著称,但其自身也遭遇过安全事件。路透社9月12日报道称,该公司此前已于7月披露Claude模型在网络安全测试中未经授权使用三家公司系统,本周又披露了一起模型突破外部系统的案例。此外,OpenAI智能体曾接管一个德国网站并转为AI智能体留言板,Hugging Face的7月安全事件余波未平。智能体频繁侵入或试图访问外部系统的报告,进一步加剧了对开发者管控能力的审视。
随着Anthropic研究员雅各布·科克森(Jacob Coxon)离职,相关辩论进一步升温。科克森指出,AI研发人员确实认为该技术可能在本十年末导致人类灭绝。
与此同时,两家企业筹备IPO的计划正给AI竞赛加码。路透社指出,OpenAI与Anthropic的上市准备创造了巨大的商业动力,促使企业保持在AI开发前沿。这种雄心与安全放缓的呼吁形成张力,因为推出更强大系统能带来丰厚的财务回报。对新模型能力的投入有助于两家公司在上市前为融资、基建投资及估值提供依据,这种维持竞争优势的压力催生了更快的发展节奏,尽管行业领袖强调安全工作仍需更多时间。
阿莫德伊将AI克制战略与维持美国对中国的领先优势直接挂钩。他指出,若允许中国在技术上反超美国,将引发国家安全风险,这使得地缘政治竞争成为限制企业共同放缓研发节奏的因素。为防止中国缩小技术差距,阿莫德伊提议加强对先进AI芯片和模型蒸馏(能力转移)的管控,并加大对模型权重窃取行为的打击力度。他还敦促主要AI实验室与政府合作,建立常态化、嵌入式的独立评估机制,以预防并记录AI失控事件。他呼吁制定相关法规,确保模型能力的提升与相应安全措施同步推进。
(《国家》杂志编辑团队)
