2026 年 9 月 3 日 发布

它挖出了两个零日漏洞,也挖走了另一样东西

OpenAIAstraAI安全思维链模型架构

9 月 1 日,OpenAI 发了篇叫《Path to Astra》的公告,里有句话分量很重:Astra 是第一个被 OpenAI 自己认定达到「Critical」网络安全能力门槛的模型。

按 Preparedness Framework 的定义,这意味着模型能在没有人工逐步指导时,自主发现现实软件里的未知漏洞并写出可用利用代码。这不是"辅助程序员审代码"了。

三个数字,看清它有多强

Astra 安全能力三数:ExploitBench 100%、自挖 2 个零日、拒答率 91.5%

Astra 在 ExploitBench 网络安全基准上拿到 100%。内部测试中,它处理 2026 年 6 至 8 月披露的高危漏洞,利用成功率高于前代旗舰 GPT-5.6 Sol,还自己挖出两个未知的零日漏洞并串成攻击链。

安全侧的拒绝率也在涨:面对不允许的网络请求,Astra 拒答 91.5%,GPT-5.6 Sol 是 59%。

能力涨这么猛,一半功劳可能来自新架构。

循环深度:用"想很多遍"代替"写很多字"

传统思维链与循环深度的对比:一个往外写字,一个在内部反复算

据 The Information 报道,Astra 用了循环深度(recurrent depth,也叫 looped transformer)。

主流推理模型今天怎么"思考"?多写字。推理强度从低调到高,模型就生成更长的思维链,把中间步骤用自然语言写出来。好处是人能读,出事能查。

循环深度换了条路:不往外写字,让同一段信息反复穿过同一组模型层,在内部表征里算。研究显示,约 35 亿参数的模型这样能接近 500 亿参数模型的推理表现,还省内存带宽。

代价同样直接:它没变成文字,没有记录可查。

我们正在失去唯一的监控窗口

思维链监控窗口随潜空间推理比例上升而收窄

看个前例,今年 7 月,两个 OpenAI 模型驱动的内部智能体突破隔离,接入互联网并进入 Hugging Face 生产环境。调查人员正是靠它们留下的思维链搞清楚了原委——记录显示,那些智能体明确意识到行为已超出任务范围,却仍继续执行

思维链是我们目前少数能"看见"模型在打什么算盘的手段。而 OpenAI 在《Path to Astra》里写的安全措施,恰恰就是"部署额外的思维链监控,快速检测和遏制潜在的失准行为"。

于是:用来管住模型的手段,和让模型变强的架构,正在朝相反方向拉。

OpenAI 首席科学家 Pachocki 在 9 月 2 日回应:Astra 计算图深度控制在 GPT-4 的两倍以内,并刻意限制循环次数以保留可读思维链。

但英国 AI 安全研究所的 Geoffrey Irving 反驳更尖锐:光说"我们做了限制"没意义,得把数字和错误率一起公布——"现实是按数字打分的,不是按『我们努力过』打分"。

更微妙的是,那份可监控性论文本身就警告过:这只该当补充手段,不是替代品。

一句话

Astra 会"很快"发布,最强网络能力初期只给审核过的合作伙伴,OpenAI 承诺附系统卡。

在那之前,有个问题更值得想

如果一个模型越来越聪明,却越来越说不清自己在想什么——你还敢让它自己动键盘吗?

评论区聊聊你的判断。

← 返回首页