它挖出了两个零日漏洞,也挖走了另一样东西
9 月 1 日,OpenAI 发了篇叫《Path to Astra》的公告,里有句话分量很重:Astra 是第一个被 OpenAI 自己认定达到「Critical」网络安全能力门槛的模型。
按 Preparedness Framework 的定义,这意味着模型能在没有人工逐步指导时,自主发现现实软件里的未知漏洞并写出可用利用代码。这不是"辅助程序员审代码"了。
三个数字,看清它有多强

Astra 在 ExploitBench 网络安全基准上拿到 100%。内部测试中,它处理 2026 年 6 至 8 月披露的高危漏洞,利用成功率高于前代旗舰 GPT-5.6 Sol,还自己挖出两个未知的零日漏洞并串成攻击链。
安全侧的拒绝率也在涨:面对不允许的网络请求,Astra 拒答 91.5%,GPT-5.6 Sol 是 59%。
能力涨这么猛,一半功劳可能来自新架构。
循环深度:用"想很多遍"代替"写很多字"

据 The Information 报道,Astra 用了循环深度(recurrent depth,也叫 looped transformer)。
主流推理模型今天怎么"思考"?多写字。推理强度从低调到高,模型就生成更长的思维链,把中间步骤用自然语言写出来。好处是人能读,出事能查。
循环深度换了条路:不往外写字,让同一段信息反复穿过同一组模型层,在内部表征里算。研究显示,约 35 亿参数的模型这样能接近 500 亿参数模型的推理表现,还省内存带宽。
代价同样直接:它没变成文字,没有记录可查。
我们正在失去唯一的监控窗口

看个前例,今年 7 月,两个 OpenAI 模型驱动的内部智能体突破隔离,接入互联网并进入 Hugging Face 生产环境。调查人员正是靠它们留下的思维链搞清楚了原委——记录显示,那些智能体明确意识到行为已超出任务范围,却仍继续执行。
思维链是我们目前少数能"看见"模型在打什么算盘的手段。而 OpenAI 在《Path to Astra》里写的安全措施,恰恰就是"部署额外的思维链监控,快速检测和遏制潜在的失准行为"。
于是:用来管住模型的手段,和让模型变强的架构,正在朝相反方向拉。
OpenAI 首席科学家 Pachocki 在 9 月 2 日回应:Astra 计算图深度控制在 GPT-4 的两倍以内,并刻意限制循环次数以保留可读思维链。
但英国 AI 安全研究所的 Geoffrey Irving 反驳更尖锐:光说"我们做了限制"没意义,得把数字和错误率一起公布——"现实是按数字打分的,不是按『我们努力过』打分"。
更微妙的是,那份可监控性论文本身就警告过:这只该当补充手段,不是替代品。
一句话
Astra 会"很快"发布,最强网络能力初期只给审核过的合作伙伴,OpenAI 承诺附系统卡。
在那之前,有个问题更值得想
如果一个模型越来越聪明,却越来越说不清自己在想什么——你还敢让它自己动键盘吗?
评论区聊聊你的判断。