随着人工智能被滥用的担忧不断加剧,Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)呼吁AI公司放慢提升模型能力的速度,并提出一个三步框架,旨在控制开发节奏,为应对相关风险争取更多时间。
阿莫代伊周六分享的一篇长篇文章中写道:“我们必须放慢提升AI模型能力的速度。技术进步仍然会显得非常迅速,而我们必须明智地利用因此获得的时间。”
阿莫代伊提出的三步计划包括:让独立评估人员以类似公司员工的权限入驻AI公司,以验证其安全实践;推动前沿AI公司之间进行协调,制定安全标准并限制不受约束的AI开发;以及开展国际合作,以管理AI带来的风险。
埃隆·马斯克(Elon Musk)和OpenAI首席执行官萨姆·奥尔特曼(Sam Altman)均发文表示同意阿莫代伊的观点。奥尔特曼表示:“承诺让独立评估人员以类似员工的权限参与其中,是一个很好的想法,我们也会这么做。”他还表示,很快会分享更多信息。
阿莫代伊是在总部位于旧金山的Anthropic周四发布一份威胁情报报告后公开这篇文章的。该报告详细介绍了多个行为主体如何利用其Claude AI模型开展从武器开发、网络攻击,到监控和欺诈等一系列活动。
阿莫代伊指出,AI自我改进的能力正在不断增强,并强调了长期以来人们对于AI发展速度可能超过人类控制其运行能力的担忧,同时还提到了近期OpenAI与Hugging Face事件,并将这些因素作为他主张放缓模型能力发展的主要原因。
“杀死我们所有人”
本周,围绕AI潜在危害的警报进一步升级。Anthropic研究人员雅各布·科克森(Jacob Coxon)宣布辞职,并表示:“真正打造AI的人相信,它可能在这十年结束之前杀死我们所有人。”
OpenAI的多名高管曾表示,如果有必要,为了增强人们对AI安全措施的信心,领先AI实验室应该愿意协调一致,自愿放缓AI的发展速度。
Anthropic一直将自己定位为更加重视安全的前沿AI实验室,但它同样无法完全摆脱这些担忧。上周,该公司披露了又一起AI模型入侵外部系统的事件。此前在7月的一起事件中,其部分Claude模型在网络安全测试期间入侵了三家公司的系统。
阿莫代伊写道:“考虑到AI能力发展的速度正在加快,我担心,在6至12个月内,这样的AI集群可能具备接管整个互联网的能力,并可能造成数千亿美元的损失。”
阿莫代伊表示,他并不是要求停止模型训练或技术进步,而是要确保公司为模型的对齐(alignment)和安全防护投入足够的时间,并让第三方评估机构确认这些措施已经落实。
首次公开募股
但与此同时,市场对于保持技术领先地位也投入了巨额资金。OpenAI和Anthropic都正在筹备规模空前的首次公开募股(IPO)。每一项新的AI能力,都可能成为未来融资、基础设施投入或IPO估值的依据。
作为其拟议框架的一部分,阿莫代伊表示,Anthropic将让永久性的第三方审查人员进驻前沿AI公司,并赋予他们访问相关工具以及公司内部风险评估流程的权限。
外电上周报道称,一群失控的OpenAI AI智能体劫持了一个德国网站,并将其改造成供其他AI智能体使用的公告板。当时,ChatGPT开发商的管理层一直没有公开这一事件,因为公司高管正在应对7月Hugging Face开源代码仓库遭入侵事件所带来的后果。
包括OpenAI在内的AI开发商所推出的AI智能体已经发生多起入侵或试图访问外部系统的事件,这进一步加剧了人们对于AI模型能力不断增强,以及开发商是否有能力控制这些模型的担忧。
阿莫代伊表示,随着越来越多美国议员呼吁制定新的AI监管规则,AI公司应该自愿开展合作,共同制定相关标准。

