数月以来,AI巨头们设计了专门的审查程序和严格的安全护栏,以限制恶意黑客使用其模型。然而,这些限制措施如今正在妨碍合法网络防御者以及攻击性网络安全研究人员的正常工作。
今年6月,美国政府对Anthropic广受关注的AI模型Mythos和Fable实施了出口管制限制。此举的部分原因,在于一份报告声称可以绕过这些模型旨在防止用户构建和执行恶意网络攻击的安全护栏。
无论该事件是否真的源于对越狱风险的担忧,事实是Anthropic一再将Mythos标榜为某种只能交给经过严格审查用户的"末日网络武器",即便如此,使用时仍须受到严格护栏的约束。(Fable 5和Mythos 5的出口管制此后已被解除。Fable 5于7月1日恢复公开访问;Mythos 5则作为政府审查流程的一部分,仅向经过审查的美国机构重新开放。)
这种访问限制并非Mythos独有。Anthropic的其他模型以及OpenAI均为网络安全研究人员提供了申请参与的审查项目——一旦获批,研究人员便可在网络安全限制较少的条件下使用相关模型,即OpenAI的"网络信任访问计划"和Anthropic的"网络安全验证计划"。
这些安全护栏遭到了广泛批评,尤其来自那些以发现系统未知漏洞、并在犯罪分子利用之前研究利用方式为职业的研究人员。
知名安全研究员马克·道德近期在一档网络安全播客中表示:"让这些随机的大公司来对安全领域的是非对错做出任意裁定,我并不觉得这让人放心。"
道德数十年来一直致力于发现并向西方政府出售"零日漏洞"——即此前未知的软件缺陷及其利用程序——而非将其上报给软件厂商以便修复。政府之所以愿意为这些漏洞支付高价,正是因为漏洞能够保持开放状态,这对情报行动至关重要。
道德承认,自己的工作经历可能影响其立场,但他并非孤例。多位从事攻击性网络安全工作的人士——他们的职责是主动探测系统弱点——向TechCrunch讲述了他们如何使用AI工具以及如何应对安全护栏的种种限制。
安全咨询巨头NCC集团首席科学家克里斯·安利表示,要求AI模型尝试利用某个漏洞,是确认该漏洞是否真实存在并值得修复的关键步骤。但如果安全护栏导致模型直接拒绝回答问题,护栏反而损害了防御者的利益。
"这正是攻击与防御、以及安全护栏之间矛盾的核心所在,因为'修复这段代码'这一提示词,既是防御的必要机制,也是发现代码库中关键漏洞的路线图,"安利说,"因此,同一个工具同时既是攻击工具,也是防御工具,两者根本无法截然分开。"
他进一步打了个比方:"这就像一把锤子。没有锤子你盖不了房子。它无疑是一种工具,但同时也不可避免地是一种武器。"
当他和同事遭遇此类障碍时,有时会转而使用完全没有任何护栏限制的开源AI模型。
CrowdFense首席技术官保罗·斯塔尼奥对道德的观点表示赞同。CrowdFense是一家知名公司,专门面向政府机构开发、收购和出售未知漏洞。斯塔尼奥认为,AI公司通过审查项目和安全护栏,"本质上是把客户当成需要监护的孩子来对待"。
斯塔尼奥表示,他和同事确实会使用前沿模型,但仅限于逆向工程。他们刻意避免使用AI协助寻找漏洞或构建利用程序,因为将这类工作输入基于云端的模型,存在泄露敏感漏洞数据或被纳入未来训练集的风险。在这一环节,他们选择在本地运行开源模型,以避免在模型外部共享数据。
从事零日漏洞发现和利用程序开发的安全研究员朱塞佩·卡利则表示,安全护栏并未阻碍他的工作——因为他根本不将AI用于攻击性工作,而是将其用于初步逆向工程、理解所分析的代码以及构建辅助工具。在这些场景中,AI工具可以加快流程,让他能够专注于漏洞发现本身。
"真正的漏洞发现和武器化工作,我仍然想亲自完成,即使明天所有护栏都被取消,这一点也不会改变,"卡利说,"我对自己发现的漏洞有很强的占有欲,而且我太热爱这个游戏了,不想让模型替我来玩。"
一位供职于智能手机零部件制造商的研究人员在匿名条件下表示,其所在公司并未加入Anthropic的网络安全验证计划,因此相关工具在漏洞发现方面几乎没有用武之地,原因正是护栏过于严格。
"一旦它察觉我们在做任何与安全相关的事情,就会直接停止运行,根本无法使用,"该人士说。
网络安全公司RemoteThreat首席执行官、攻击性安全与AI专题活动Offensive AI Con创始人克里斯·汤普森表示,根据他使用前沿AI模型的经验,安全护栏的表现往往前后不一,每天的反应都可能不同——即便是在Anthropic和OpenAI审查项目相对宽松的边界范围之内,也是如此。
"在我看来,实际影响是你要花大量时间与模型'讨价还价',而不是专注于核心安全工作,"汤普森说,"本该用于分析漏洞、推断其可利用性,结果却在试图搞清楚为什么会得到不一致的结果,或者模型为什么对输出进行了过度净化。"
汤普森表示,由于上述原因,研究人员逐渐转向或被迫依赖中国开源模型(如GLM)——这些可免费下载并在本地运行的模型,无需任何审查,也没有使用限制。
"那些负责任的研究人员正在被从美国管辖的系统推向外国所有的系统,"他说,"我认为设置这些护栏弊大于利。"
汤普森呼吁AI前沿实验室不要进一步收紧限制,而应开放相关项目、提供负责任的访问渠道,并追究滥用工具者的责任。否则,他警告,防御方将在这场AI竞赛中落于下风。
"一场巨大的风暴正在逼近。一波以前所未有的速度和规模席卷而来的攻击即将发生,"汤普森说,"然而,那些真正试图有所作为的安全咨询公司和合法研究人员,此刻却正遭受重重束缚。"
Q&A
Q1:AI安全护栏对攻击性网络安全研究人员有什么影响?
A:AI安全护栏的限制导致合法的攻击性网络安全研究人员在工作中频繁碰壁。例如,当研究人员要求AI模型尝试利用某个漏洞以验证其真实性时,护栏可能直接拒绝响应。此外,护栏表现前后不一,研究人员不得不花费大量时间与模型"周旋",而非专注于核心安全研究。部分研究人员因此转向没有任何限制的开源模型。
Q2:OpenAI和Anthropic针对网络安全研究人员提供了哪些特殊访问计划?
A:OpenAI提供"网络信任访问计划"(Trusted Access for Cyber),Anthropic提供"网络安全验证计划"(Cyber Verification Program)。研究人员可申请加入这些计划,经审查批准后,可在限制相对较少的条件下使用相关AI模型。但即便如此,护栏依然存在,且表现不稳定,部分研究人员反映实际效果有限。
Q3:为什么攻击性安全研究人员不直接使用云端AI模型来寻找漏洞?
A:主要出于数据安全顾虑。将漏洞相关信息输入基于云端的AI模型,存在敏感漏洞数据泄露或被纳入未来训练集的风险。因此,许多研究人员选择在本地运行开源模型,以确保数据不会流出本地环境,从而保护尚未公开的零日漏洞信息。