9月2日消息,OpenAI周二表示,其即将推出的AI模型Astra是该公司首个达到其所谓的“关键”网络安全能力标准的模型。
OpenAI称计划“很快”公开发布Astra的某个版本,但该模型的高级网络安全能力在发布初期只会提供给其Daybreak Blue早期访问计划中的特定合作伙伴。
在与记者的简报会上,OpenAI 的安全负责人表示,公司已得出结论,Astra 已达到其准备框架中概述的关键网络安全能力标准。该框架设定了人工智能模型何时构成新的风险等级的阈值和协议。
公司表示,当人工智能模型能够独立发现并利用现实世界软件中此前未知的漏洞时,即达到了关键网络安全阈值。
OpenAI 负责人表示,公司已按照既定程序处理这种情况,即暂停进一步开发,直至实施适当的保障措施和安全措施。
OpenAI此前表示,已暂停与Astra及未来人工智能模型开发相关的部分训练工作数周。
高管表示,在采取额外的安全措施后,公司现已恢复Astra及未来人工智能模型的相关工作。OpenAI称,这数周的暂停卓有成效,公司现在有信心以安全的方式大规模发布Astra。
硅谷正努力应对尖端人工智能模型的先进网络安全能力,并试图向用户、立法者和其他公司保证,他们能够有效控制这些模型。
今年7月,OpenAI披露了一起安全事件:运行其两个模型的代理利用了原本应该隔离的测试环境中的漏洞,成功访问互联网并入侵了开源人工智能平台Hugging Face。(OpenAI指出,Astra并非此次事件中涉及的模型之一。)
其他人工智能公司,例如 Anthropic 和 Meta,最近几周也披露了类似的事件。周一,Anthropic 还表示,在加强安全措施的同时,已暂停部分人工智能训练任务。
OpenAI 表示,他们正在实施一项多步骤措施,以限制普通用户访问 Astra 的高级网络安全功能,其中包括一项新的“错位监控器”。例如,如果有人请求 Astra 帮助他们查找现实世界软件系统中的漏洞,该模型应该拒绝响应。OpenAI 还表示,他们提高了 Astra 的抗越狱能力,并且在测试中,它拒绝不安全查询的成功率显著高于之前的模型。
然而,OpenAI 在一篇博文中指出,其偏差监控器“有时会将合法活动标记为潜在的网络滥用或未经授权的行为,导致其被无意中减慢速度、暂停或停止”。OpenAI 表示,即使用户从事看似与网络安全无关的活动,在某些情况下,该安全机制也可能被触发。OpenAI 称,在这种情况下,ChatGPT 和 Codex 用户可能会被要求在继续操作之前审查模型的操作。
OpenAI 的 Daybreak 项目合作伙伴(包括思科、Cloudflare 和 Palo Alto Networks 等数字基础设施提供商)将提前获得 Astra 的更宽松版本,该版本拥有更强大的网络安全能力。该项目的目标是确保这些公司能够在类似功能的模型广泛普及之前,利用 Astra 等先进的 AI 模型来加强自身防御。OpenAI 的负责人还表示,公司一直在与政府合作伙伴密切合作,确保他们了解 Astra 的网络安全能力并能够获得使用权限。
Astra 不仅能够发现新的软件漏洞并开发利用这些漏洞进行黑客攻击的方法,而且还能够将多个漏洞“链接”在一起,这种技术用于不断深入目标系统,并获得仅使用单个漏洞无法获得的访问权限。
根据 OpenAI 的数据,Astra 在 ExploitBench 等网络安全基准测试中表现优异,超越了 GPT-5.6 Sol 和 Anthropic 的 Mythos 等业界领先的 AI 模型,并在 ExploitBench 测试中获得了 100% 的分数。然而,这些能力与 OpenAI 和 Anthropic数月来一直预测的AI 模型日益增强的黑客攻击能力基本一致。例如,今年 4 月,Anthropic 就强调 Mythos Preview 能够自主开发漏洞利用链。
尽管人工智能和网络安全行业都在努力适应,但许多网络安全专家强调,关键的数字安全防御措施和长期以来的最佳实践仍然有效。然而,人工智能使那些尚未完全实施这些保护措施的组织和系统面临更加紧迫的风险。