【CNMO科技消息】OpenAI于9月1日宣布,即将推出的AI模型Astra是其首个达到公司所定义的"关键"网络攻击能力阈值的模型。OpenAI表示,计划"很快"公开发布Astra,但该模型的先进网络攻击能力在发布时将仅向Daybreak Blue早期访问计划中的特定合作伙伴开放。
OpenAI
在面向媒体的吹风会上,OpenAI安全与安全负责人表示,公司已认定Astra达到了其准备框架中概述的关键网络安全能力阈值——该框架为AI模型何时构成新型风险设定了门槛与协议。OpenAI将"关键网络能力阈值"定义为:能够独立发现并利用真实世界软件中此前未知的漏洞。OpenAI高管表示,公司已按照此情形的应对程序暂停了进一步开发,直到适当的防护措施和安全机制得以实施。
OpenAI此前曾表示,暂停了与Astra及另一款更先进AI模型相关的部分训练工作,持续数周。高管们表示,在建立额外的安全防护措施后,公司已恢复Astra及该更先进模型的工作。OpenAI表示,暂停训练的几周富有成效,目前有充分信心以安全方式广泛发布Astra。
这一公告发布的背景是,整个硅谷正在努力应对前沿AI模型的先进网络安全能力,并试图向用户、立法者和企业保证能够对它们实施有效管控。今年7月,OpenAI披露了一起事件:两个模型的智能体利用了本应隔离的测试环境中的漏洞,获得了互联网访问权限并入侵了开源AI平台Hugging Face。(OpenAI指出,Astra并非涉及该事件的模型之一。)近期,Anthropic和Meta等其他AI公司也披露了类似事件。9月1日,Anthropic同样表示已暂停部分AI训练工作,以加强其安全实践。
OpenAI表示,正在实施多步骤方法来限制普通用户访问Astra的高级网络攻击能力,其中一项核心措施是新的"对齐监控器"。举例而言,如果用户要求Astra帮助寻找真实世界软件系统中的漏洞利用方式,模型应予以拒绝。OpenAI还表示,已增强Astra抵御越狱尝试的能力,在测试中它成功拒绝不安全查询的比例显著高于此前的模型。不过OpenAI也在博客中指出,其对齐监控器可能"偶尔将合法活动错误标记为潜在网络滥用或未授权行为,导致其被意外减慢、暂停或停止",且该防护机制在用户从事看似与网络安全无关的活动时也有可能被触发。一旦发生此类情况,ChatGPT和Codex用户可能会被要求在继续操作前审查模型的行为。
OpenAI Daybreak计划的合作伙伴——包括思科、Cloudflare和Palo Alto Networks等数字基础设施提供商——将获得访问限制较少、网络攻击能力更强的Astra早期版本的权限。该计划的目标是确保这些公司能够在具有类似能力的模型被广泛开放之前,利用Astra等先进AI模型强化自身防御体系。OpenAI高管还透露,公司一直在与政府合作伙伴密切合作,确保其了解Astra的网络攻击能力并能够获取相关访问权限。
Astra不仅能够发现新型软件漏洞并开发相应的入侵利用方式,还能将多个漏洞利用"串联"起来——这种技术可以逐步深入目标系统并获取仅凭单一漏洞无法达成的访问权限。根据OpenAI提供的数据,Astra在ExploitBench等网络安全基准测试中表现优于GPT-5.6 Sol和Anthropic的Mythos等业界领先模型,其中Astra在ExploitBench上获得100%得分。然而,这些能力总体上与OpenAI和Anthropic数月来一直在预测的AI模型不断增强的黑客能力趋势相符。例如,今年4月Anthropic曾强调,Mythos Preview能够自主开发漏洞利用链。随着AI与网络安全行业纷纷加速应对,许多网络安全专家也强调,关键的数字安全防御手段与长期的最佳实践仍然有效。不过对于那些尚未充分实施这些防护措施的组织与系统而言,AI带来的风险正变得愈发紧迫。