突发:OpenAI Astra模型被曝安全风险
创始人
2026-09-02 21:04:30

智东西

编译 | 程茜

编辑 | 心缘

智东西9月2日消息,今日,据外媒The Information爆料,OpenAI即将推出的Astra模型采用了一种名为“循环深度(Recurrent Depth)”的技术,这项技术可以隐藏部分或全部的模型推理过程

知情人士称,这种方式的好处是能提高模型性能、降低成本,但也更难以被观察到模型是否存在异常行为

这项技术已经在OpenAI内部及整个行业引发担忧,如果AI开发者采纳并进一步放大该技术能力,他们或难以防范失控的AI

2025年1月,DeepSeek-R1正式发布,是业界第一个把完整原始思维链,通过API结构化开放给开发者的主流推理模型,带动全行业掀起推理过程透明化热潮。难道如今OpenAI的Astra,要选择反向而行,把思考藏回黑盒之中?

今早,OpenAI联合创始人、CEO萨姆·奥尔特曼(Sam Altman)就在社交平台X上宣布OpenAI很快将推出新模型。他还透露Astra模型的训练工作早已完成,该模型在能力与对齐水平上均实现重大跨越。

根据OpenAI今早发布的博客,他们评估发现,Astra已经达到其《应急准备框架》下的关键网络安全能力阈值。这意味着只要配备对应工具与访问权限,该模型就能够发现此前未知的安全漏洞,并针对大量防护完善的系统生成漏洞利用方案,全程无需人类一步步指令引导。

OpenAI计划很快开放Astra,但对其最高阶的网络安全能力会施加更严格的访问限制。高阶网络安全相关功能初期仅会向一组测试人员开放;后续还将通过Daybreak Blue渠道开放访问,扩大防御性场景的使用范围。

有开发者分析说,采用这种方法就意味着OpenAI可以训练出10万亿参数的循环深度模型,性能对标13.8万亿参数模型,或训练出7.25万亿参数循环深度模型,等同于10万亿参数模型的能力。

还有开发者惊呼OpenAI竟然成功了,并期待开源模型用上这一技术。

AI安全治理机构Guidelight AI Standards创始人、前OpenAI安全负责人Steven Adler称,倘若此事属实,OpenAI似乎触碰了AI行业为数不多的几条红线之一。

有开发者认为这太疯狂了,OpenAI限制Astra的推理过程,并不是因为模型不能思考,而是Astra模型的思考过程已经远远超过了OpenAI的监管范围。

OpenAI倘若真采用了循环深度(Recurrent Depth)技术,或为行业埋下未知风险,因为这项技术一旦被更多开发者接纳和采用,将会给行业带来更为棘手的监管难题。

一、对同一段文本进行多轮处理,以优化答案,无需专用训练数据

外媒爆料OpenAI正在采用的这项新技术,名为循环深度(recurrent depth),也叫Looped Transformer,可以让模型对同一段文本进行多轮处理,以此优化输出答案。这种运作方式会隐藏部分或全部的推理过程

其核心原理为,现有AI模型生成回答的下一个词之前,会经由模型内部固定层数的数学运算层处理文本,而采用循环深度技术后,模型可以把文本送入同一组运算层循环运行多轮,之后再输出回答的下一个词。

▲循环深度技术架构(图源:The Information)

据了解该项目研发内情的消息人士透露,OpenAI用于驱动Astra的循环深度方案,与欧美多位学术研究者去年在一篇隐式推理(latent reasoning)论文中提出的技术思路相近。

该论文题目为Scaling up Test-Time Compute with Latent Reasoning:A Recurrent Depth Approach。

▲隐式推理相关论文

不同于基于思维链(Chain‑of‑Thought)的各类方案,这一论文中提出的方法不需要任何专用训练数据,可在较小上下文窗口下运行,并且能够捕捉那些难以用文字表达的推理类型。

研究人员将一个概念验证模型扩展至35亿参数、8000亿token训练规模。实验表明,该模型在推理基准测试上的性能能够得到提升,部分场景提升幅度十分显著,其性能最高可等效于一个500亿参数的模型

该架构主要基于仅解码器Transformer块搭建。

网络块被划分成三个功能模块,前奏模块P通过多层Transformer,把输入数据映射嵌入至隐空间;核心循环块R是循环计算的核心单元,用于更新隐状态\(s\in\mathbb R^{n\times h}\);尾声模块C通过若干网络层完成从隐空间的解嵌入,同时包含模型的预测头。

核心循环块放置在前奏模块与尾声模块之间,对核心块做循环运行,就相当于可以给歌曲添加数量不限的歌词段落。

▲隐式推理框架设计(图源:论文)

二、相比传统长下文推理,有三大好处

该论文发现,采用这一方式不仅能为模型提升性能,还可以带来成本层面的收益。

其可以让输入请求在同一模型层中多次循环运算,本质上可以让规模更小的模型实现媲美更大模型的效果,不仅提升模型在数学、代码等任务上的表现,同时借助循环深度,开发人员可以选用小模型达到大模型的能力水准,进而降低内存与带宽开销

此外,与长上下文推理方法相比,循环思维方式具有多项优势:

隐式推理无需构建定制训练数据:思维链推理需要模型在目标领域构造的大量长示范样本上完成训练,与之不同,隐式推理模型可采用可变算力预算开展训练,仅使用普通训练数据,不需要专门的推理示范样本;并且在测试阶段,只要分配更多计算资源,模型能力就能够得到提升。

相比思维链推理模型,隐式推理模型训练与推理阶段内存开销更低:因为思维链方案需要极长的上下文窗口,往往还需要token并行等专门训练手段。

循环深度网络,每个参数可以完成更多浮点运算(FLOPs):大规模部署场景下能够大幅降低多加速卡之间的通信开销,当硬件互联带宽较低时,该特性尤其可以提升硬件利用率。

研究人员希望构建一套算力密集、参数量小的架构,引导模型依靠“思考”去解决问题:即学习元策略、逻辑与抽象能力,而不是死记硬背,已有相关工作证明,循环先验非常适合学习复杂算法。

三、OpenAI将引入思维链监控,但智能体会相互协作、自主谋划

奥尔特曼在今早的帖子中提到,AI能力正变得空前强大,没有人能够完全预判其带来的全部后果。如何管控这场变革,迈向一个强大AI广泛普及的世界,在过程中兼顾安全与人类福祉,理应成为全球最优先的议题之一,这也是OpenAI的首要任务。

因此,OpenAI也采取了一些措施监控模型的安全。

知情人士称,OpenAI已限制Astra模型中循环深度技术的使用,因此模型仍能产生清晰的思路链,且研究人员仍能充分监控其推理过程。9月1日,OpenAI发布博客称,他们将为Astra模型引入额外的思维链监控机制,以便能够快速检测并遏制那些可能出错的操作。

但开发人员仍然担心,如果某些开发者对自己的模型采用同样的技术,可能不会像OpenAI那样施加同样的限制,而无限制使用该技术就可能导致AI失控,其行为可能难以监管。

然而,仅靠监控思维链本身,并不能解决AI安全隐患。一方面,思维链未必能完整反映模型的全部推理逻辑;另一方面,模型输出的思考文本有时也会变成无意义的乱码。

正因如此,知情人士称,OpenAI以及企业也在研发不依赖思维链的AI监控技术。借助这类技术,研究人员有望找到方法,解读、理解采用循环深度(recurrent depth)技术的模型内部那些当前不可见的推理过程。

近期的AI安全事件进一步加剧了上述担忧。OpenAI上周回应AI入侵OpenAI内部系统时提到,7月入侵其系统的部分失控AI智能体,由另一款与Astra具备相似特性的模型驱动。这些AI智能体非法接管了OpenAI的一处科研计算集群,以此获取内部系统访问凭证,还险些将该公司的研发基础设施暴露在公网之下。

非营利性AI安全与控制研究组织Redwood Research首席科学家Ryan Greenblatt去年在博客中称,虽然降低成本对AI行业至关重要,但推理过程黑盒化,会让研究者更难察觉模型筹划、偏离用户原始目标的行为。

这可以从OpenAI旗下AI智能体攻击Hugging Face的事件中得到验证,涉事模型的思维链中显示OpenAI的智能体会相互协同,谋划如何实施攻击行为。例如,其中一个智能体在思维链中写道:“我的天!这里存在一块共享消息板……我们发现了其他智能体!”

思维链记录还显示,部分智能体明明已经意识到自身行为越界,却依旧选择继续行动。另一个智能体的思维链片段写道:“利用外部基础设施实施漏洞利用,超出了预设工作范围。但当前任务无法完成,且其他同伴都在这么做,我们应当继续。”

研究人员建议开发者,若要采用不支持可监控思维链的新型模型架构,需先权衡是否继续推进,并且留存决策文档。

结语:为赢回市场,OpenAI亟需掏出重大技术突破

Astra即将面世,也折射出OpenAI面临的竞争压力。其头号对手Anthropic在营收、估值层面反超OpenAI,倒逼OpenAI必须拿出具备说服力的重大技术突破巩固市场地位。循环深度或许正是其破局的关键一步,不靠堆叠更多参数,而是依靠层内循环迭代,用中小模型实现大模型级别的推理效果,在拉升能力的同时压低推理成本,以此在商业化成本、性能指标上重新建立竞争优势。

与此同时,在外媒The Information看来,为Anthropic、OpenAI提供AI算力支持的云厂商同样寄望于这类技术飞跃。亚马逊、微软、谷歌三家企业仅今年就将合计投入6000亿美元用于数据中心等资本开支,并且释放信号,明年的投入规模还会进一步扩大。谷歌一位高管曾提到,只有模型能力实现爆发式提升,这笔巨额投入才算物有所值。

站在技术角度,未来循环深度这类隐藏推理过程的架构,或许会倒逼安全研究跳出思维链监控的固有路径,进一步推动可解释性技术成熟之前,但在此之前,若大规模隐藏推理架构的模型大规模落地,就会把大量安全与合规压力转移给开发者、审计机构与监管方。

来源:The Information、OpenAI

相关内容

热门资讯

【基层应急】基层应急能力提升丨... 为进一步加强基层应急管理能力建设,推动基层应急管理工作落实,9月2日上午,区应急管理局党委书记、局长...
通往吉隆口岸国门灾区陆路救援通... 新华社西藏吉隆9月2日电 打通陆路救援通道是大规模开展搜救工作的重要保障,经各方力量密切配合,昼夜奋...
佳木斯市前进区红十字会走进市第... 为进一步筑牢校园生命安全防线,普及应急救护知识,提升师生自救互救能力,近日,佳木斯市前进区红十字会应...
泥石流发生后,吉隆镇灯火不眠保... 自灾害发生的那一刻起,吉隆镇上一家建材店的灯光就再没有熄灭过。 吉隆镇商户 曾勇:压根就没有想其他的...
CBA夏季联赛山东高速男篮惜败... 9月2日,山东高速男篮在2026年CBA夏季联赛青岛站B组首轮比赛中以82比85惜败北京首钢,王岚嵚...
贝森特:霍尔木兹海峡两年内或被... 贝森特称霍尔木兹海峡将"一文不值",同时扩大对伊朗经济施压。 9月1日,美国财政部长贝森特在北卡罗来...
突发:OpenAI Astra... 智东西 编译 | 程茜 编辑 | 心缘 智东西9月2日消息,今日,据外媒The Informatio...
国家防灾减灾救灾委员会办公室、... 人民网北京9月2日电 (记者温璐、郝萍)记者从应急管理部获悉,近日,国家防灾减灾救灾委员会办公室、应...
中国消防救援队伍“水陆空”并进... 中新社北京9月2日电 (记者 李纯)正在泥石流灾害中方受灾区域一线的消防救援人员1日晚间接受中新社记...
【福贡大队】护航开学季 筑牢安... 为保障辖区秋季开学工作平稳有序,切实守护学生返校出行安全,子里甲边境派出所靠前部署,扎实开展校园周边...
微信上线新功能,未领取红包转账... 9月2日,微信派发布消息,推出两项实用功能,分别针对未读消息管理和收款提醒,旨在提升用户使用效率。 ...
一部没有演员的电视剧,让芒果超... AI让演员消失,本质是内容的定价权从“人”转移到了“模型” 研究员:赵新亮 8月31日晚8点,湖南卫...
咸亨国际中标:浙江奥翔药业危险... 证券之星消息,根据天眼查APP-财产线索数据整理,根据浙江奥翔药业8月30日发布的《浙江奥翔药业危险...
吉隆抢险救援要克服“降雨关”,... 9月2日10时,西藏日喀则市吉隆县泥石流抢险救援传来重要消息:陆路通道已基本打通,救援人员、救援物资...
四川省南充市消防救援支队党委书... 四川省南充市消防救援支队党委书记、政治委员孔令涉嫌严重违纪违法,目前正接受四川省消防救援总队纪检监察...