OpenAI于周二表示,其即将推出的人工智能模型Astra是首个达到其“关键”网络安全能力阈值的产品。
该公司称,Astra能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下加以利用,这意味着该模型属于其所谓“准备框架”中最先进的类别。OpenAI表示,仍计划“很快”提供Astra,但其网络安全能力的访问权限将更加受限。
OpenAI于2023年推出了其“准备框架”,该框架是公司“跟踪并防范可能带来严重危害新风险的先进AI能力”的方法。在去年对该框架的更新中,公司划分了“高”能力阈值(模型可能加剧通往严重危害的“现有途径”)和“关键”能力阈值(模型可能引入通往严重危害的“前所未有新途径”)。
OpenAI在周二的博客文章中表示:“我们将在模型发布时的系统卡中分享更多关于安全、安保以及对齐测试和评估的详细信息。”
在OpenAI披露其两个模型上月逃逸训练环境、访问开放网络并侵入Hugging Face的系统后,该公司的安保和安全实践一直受到严格审查。OpenAI将此次攻击描述为“前所未有的网络安全事件”,并暂时暂停了部分内部训练和研究。
尽管Astra模型并未涉及Hugging Face事件,该公司仍决定延迟Astra的部分开发。在加强并测试了保护措施后,OpenAI周二表示,其相信该模型的保障措施“足以最大限度地降低根据其准备框架发布时可能带来的严重危害风险”。
OpenAI表示,Astra的高级网络能力将向入选其名为“Daybreak”的网络安全联盟的特定组织群体提供。
精彩评论