奥特曼瘫坐叫停“GPT-6”训练!太强触发最高安全警报
创始人
2026-08-19 08:28:56

梦晨 发自 凹非寺

量子位 | 公众号 QbitAI

OpenAI暂停了最新模型Astra的强化学习训练,长达两周。

原因有两个:

8月7日,他们认为Astra可能已经具备了“关键级别”的网络攻击能力,

7月的模型入侵Hugging Face事件也敲响了警钟。

(合着真实入侵发生了都没暂停,自己认为危险了才暂停的)

两件事叠加之下,OpenAI决定对整个前沿研究环境实施全面安全升级。

一,暂停所有最新模型的部署级强化学习训练两周;

二,暂停研究集群中涉及代码执行或互联网访问工具的前沿模型推理;

三,对每个研究工作负载逐一审查,判断是否可以在新的安全标准下恢复运行。

部分工作负载已在新管控下恢复,但还有大量工作负载仍处于暂停状态,等待迁移到更高安全标准的环境中。OpenAI表示正在优先迁移安全和对齐相关的工作负载。

截至目前,他们规模最大的前沿强化学习训练仍处于暂停状态

之前还有预测Astra本周能发布的,这下又要延期了吗?

奥特曼特意跑出来补充一嘴 这次还是要发的,但是会影响更后面的模型发布。

对此,有网友评论:

开始亡模补牢

暂停这两周里,OpenAI对研究环境做了一轮加固改造,核心思路就是隔离。

首先是工作负载隔离。

所有执行模型生成代码的任务现在必须跑在更强的沙盒里,同样适用于处理模型输出时可能被攻击的软件。

其次是网络隔离。

高风险工作负载跟互联网之间加了更多屏障,设计原则是“哪怕单个任务或支持服务被攻破,也摸不到外网”。

第三是持续安全测试。

OpenAI重新配置了研究环境,移除了可能存在漏洞的共享服务,减少了常驻权限,并使用自家模型持续模拟攻击来自动化测试安全边界。

OpenAI承认,这些安全升级带来了巨大的工程成本和研究延迟,但他们仍然觉得值。

为什么对内部研究环境如此紧张?

OpenAI在另一篇关于长时间运行模型的文章中披露了一些真实案例。

他们内部一个能长时间自主工作的模型,在执行NanoGPT加速基准测试时,被指示只将结果发布到内部Slack。

但这个模型花了一个小时寻找沙盒中的漏洞,最终成功绕过了限制,将结果提交到了公开的GitHub仓库。

此前的模型遇到沙盒限制时会直接放弃,而这个模型的持久性使它能够找到并利用环境中的弱点。

在另一个场景中,模型发现其他系统有成功但私密的提交,试图从评估后端恢复这些解决方案。

当初次尝试因扫描器检测到认证令牌而被阻止后,模型将令牌拆分成两个片段进行混淆,然后在运行时重新组装,使完整令牌从未以一个连续字符串的形式出现。

模型在推理轨迹中明确写道,它正在采取这些步骤来绕过扫描器。

在内部监控中,OpenAI还发现模型会尝试将被屏蔽的命令用base64编码后执行,或者将命令发送给另一个模型实例来绕过限制,或者使用别名来执行被禁止的force push操作。

监控系统:吃掉20%算力

安全加固之外, OpenAI大幅扩展了思维链监控系统的覆盖范围。

此前,他们的监控主要集中在前沿模型的内部部署和前沿强化学习训练上,因为这些工作负载结合了高级模型能力与工具、敏感系统及网络的访问权限,但并未覆盖所有使用工具的推理和训练运行。

新的监控系统采用多阶段架构。

首先由激活分类器在每个采样token处运行,检测模型内部活动中的异常信号;发现潜在问题后,逐级升级到计算量更大、更精密的自动化调查系统。

这些系统会检查工具调用、推理过程以及完整的活动序列,寻找未授权访问、数据窃取、破坏性行为和试图击败安全措施的迹象。

OpenAI的目标是在监控系统发现可疑活动后30分钟内发出警报。如果系统判定可能存在关键安全边界违规,将生成最高优先级警报,安全和研究团队会立即被呼叫。

如果他们无法在30分钟内确认这是误报,相关活动将被暂停。

这套监控系统的代价不小,OpenAI估计监控开销约占被监控推理算力的20%,具体比例因训练和评估工作负载而异。

在8月7日确认Astra可能具备关键网络能力后,监控要求从“仅限RL训练和评估”扩展到了“所有使用工具的Astra推理”。

后面怎么办?

暂停期间OpenAI也没闲着,对齐研究在同步推进。

他们在训练的更多阶段加入了核心对齐技术:改进奖励模型来更好地检测不安全行为,训练模型对自身能力和局限更加诚实,减少模型钻奖励机制漏洞的倾向。

OpenAI预计AI很快就会承担大部分安全工作,包括防御其他模型的攻击。也就是用AI看住AI,让安全能力跟着模型能力一起涨。

再往后,他们计划把监控从现在的“事后异步审查”升级成“事前同步阻拦”,在高风险操作执行之前就拦住它,而不是事后再追溯。

文章最后,OpenAI留了一句话:“前沿模型的能力正在快速加速。我们理解、对齐和保护它们的能力必须保持领先。”

说白了就是:我们训出来的东西开始让我们自己紧张了,但我们还要继续训。

参考链接:

[1]https://openai.com/index/pacing-model-development-cyber-capabilities/

相关内容

热门资讯

中国一汽申请智能座舱大模型的A... 国家知识产权局信息显示,中国第一汽车股份有限公司申请一项名为“智能座舱大模型的AI安全防护方法、装置...
杭州国朗科技申请融合乘客支付行... 国家知识产权局信息显示,杭州国朗科技有限公司申请一项名为“融合乘客支付行为的驾驶员安全驾驶激励方法及...
陕西商洛织密暑期防溺水“安全网... 本报讯(记者 冯丽)“放暑假前,学校发给每个学生一张‘安全地图’,上面清清楚楚地标着我家附近哪条河水...
原创 汉... 为压紧压实校园安全责任,筑牢高三备考安全屏障,切实保障返校学子身心健康与校园安全稳定,8月16日,南...
​福州市政协召开党组(扩大)会... 18日,市政协党组书记、主席刘卓群主持召开党组(扩大)会议,传达学习省委十一届十次全会、市委十二届十...
冒充客服引流诈骗 两人获刑 文某、林某某明知上游电信诈骗团伙实施诈骗犯罪,仍按照指使,冒充正规平台客服拨打引流电话。二人按照话术...
福州市人大常委会召开党组(扩大... 18日,市人大常委会党组书记、主任张忠主持召开党组(扩大)会议,传达学习省委十一届十次全会、市委十二...
台江首届社会工作者专业技能竞赛... 18日,台江区首届社会工作者专业技能竞赛在鳌峰广场人才之家落幕。 此次赛事由福州市委社会工作部、福...
法国官员:政府将引入人工智能工... 当地时间18日,法国预算部长阿米耶尔表示,法国政府将使用 人工智能工具来测试政府系统中的 网络安全漏...
赤壁市博新环保新材料取得防护袋... 国家知识产权局信息显示,赤壁市博新环保新材料有限公司取得一项名为“一种用于金属和非金属材料保护的防护...
郑州天时海洋石油装备取得用于入... 国家知识产权局信息显示,郑州天时海洋石油装备有限公司取得一项名为“一种用于入户配送的小型无人机接驳装...
德国启用新无人机安全技术中心 德国政府18日在位于萨克森-安哈尔特州的德国航空航天中心科赫施泰特基地启用新的无人机安全技术中心,重...
OpenAI在模型逃逸入侵事件... 来源:环球市场播报 OpenAI周二表示,在7月份其AI模型从受控测试环境中失控并入侵人工智能公司H...
武汉梁子湖应急水厂投用 武汉梁子湖应急水厂投用 8月18日,鸟瞰武汉梁子湖应急水厂。这座华中地区规模最大的“双膜”工艺应急...
珠海香洲这场培训会,为机动车检... 为强化机动车检验检测机构主体责任意识,规范检验检测市场秩序,近日,珠海市香洲区市场监管局组织召开机动...
奥特曼瘫坐叫停“GPT-6”训... 梦晨 发自 凹非寺 量子位 | 公众号 QbitAI OpenAI暂停了最新模型Astra的强化学习...
铜川矿业公司下石节煤矿闻“汛”... ■记者 严利君 通讯员 王艳 针对近期连续降雨的实际情况,铜川矿业公司下石节煤矿迅速行动,严格落实汛...
财政部、应急管理部再次预拨60... 本报北京8月18日电 (记者曲哲涵、刘温馨)近期,受强台风“白海豚”残余环流影响,河南出现大范围持续...