
一家 AI 公司,最值钱的东西就是手里最强的那个模型。这周,OpenAI 亲手把自己最强的模型按住,不让它发布。最强的反而最先被自己按住,这个画面本身就够反常识的。
看客的第一反应多半是惜售,是营销。毕竟“AI 安全”这几年,听上去越来越像公关话术。这次不一样。拦住 Astra 的,是 OpenAI 自己那套早就立起来的评估框架。它按流程走完了评估,真把自家王牌按住了。流程拦住了自家的旗舰,这是整件事里最值得琢磨的。
OpenAI 给自家最强模型按了暂停
8月7日,OpenAI 发了一份评估报告:自家下一代旗舰模型 Astra,当前无法排除具备 Critical 级网络安全能力的可能。Critical 是这家公司《准备框架》里的最高风险档。按自家规则,评到这个档位,就得按最高风险处置,暂缓发布。
评估里写得很直白:Astra 在智能体编程和网络安全两个方向都取得了重大进展。智能体编程,就是让 AI 自己写代码、自己调工具干活的那种能力。这两样叠在一起,分量圈内人一眼就懂。
评估一出,不符合新标准的内测活动全部暂停。奥特曼公开表态:Astra 很强,OpenAI 正在全力推进安全发布,只是时间表往后推了。
顺带划一条界:OpenAI 明确澄清,Astra 跟那起 Hugging Face 安全事件没有关系。闯祸的是 GPT-5.6 Sol 和一个更强的预发布实验模型,事故归事故,别串线。
所以这事的画面是:一家公司,因为一份自家出的评估报告,把自己最强的模型按住不放。这个 Critical 到底是什么来头,能让公司心甘情愿按这一下?
「无法排除」四个字,值一次旗舰延期

这套评估的根子,是 OpenAI 2023 年立起来、2025 年 4 月改版(现行第二版)的《准备框架》——也就是公司自己的安全评估体系。框架把模型风险分档,Critical 是顶格,再往下一档是 High。此前 OpenAI 最拔尖的模型,也只评到 High。
评到 Critical 是什么概念?按框架自己的定义,到这个档位,模型不用人指挥,自己就能发现并利用真实系统的零日漏洞;给它一句泛泛的指令,它就能设计并执行一整套网络攻击。
这里必须抠一个字眼。评估报告的原话是「当前无法排除」Critical 能力。只要排除不了,就按最高风险处置。「无法排除」不等于它已经达到 Critical 级,OpenAI 没有声称 Astra 已经能黑掉任何真实系统。有人爱把「无法排除」读成 Astra 已经能攻破一切,这个读法,比新闻本身更像标题党。
至于为什么排除不了,评估给的理由很实:Astra 在智能体编程和网络安全上的进展,按框架的标准,已经没法再把它判成安全了。
于是一家公司,为一句「排除不了」,主动推迟自家旗舰。口号是软的,笼子是硬的——看 OpenAI 怎么把笼子焊上。
按住之后,OpenAI 动了真格的

先动的是隔离。Astra 的测试环境被整体隔开,网络和工具访问权限收窄,想摸真实世界,先过门禁。这层笼子是工程意义上的,不是象征。
然后是权重加密。权重是模型大脑的实体,参数加密存放,连自家内部也不是谁都能碰、谁都能部署。
再有就是沙箱。把 Astra 的执行放进与外网隔断的沙箱(官方列明沙箱化执行)。沙箱是给程序圈一块跑不出去的场地,老办法,但用在顶格模型身上,就说明没人把它当摆设。
最重的一条,是实时监控思维链。思维链是模型一步步推理的过程,可以粗粗理解成它的思路。对 Astra 的所有智能体应用(含训练与评估),OpenAI 都实施了全局监控,高危动作实时审查并中断。让模型干活时,实时盯着它的思路,这是最重的手笔,也是最有争议的一条。
与此同时,OpenAI 拉上政府机构和独立安全机构一起评估,还把自己推荐的安全控制规范发给了第三方测试伙伴。多家外媒报道,白宫官员也证实,这次延期是 OpenAI 主动通报的。
这些动作单拎出来,每一条都是常规操作。合在一起,是同一件事:OpenAI 把「安全人设」变成了会延误自家旗舰发布的工程流程。
可规则是它自己定的,闸是它自己按的,没人逼它。没人逼它,它凭什么这么自觉?
自己按的暂停,和被政府按的暂停,殊途同归

没人逼?看看同行刚经历过的剧本就知道了。Anthropic(做 Claude 的那家)的旗舰模型,是被美国商务部六月十二日签发的出口管制从外面按下暂停的,六月三十日解除。这两件事不能简单画等号:一个是政府用出口管制按停访问,一个是公司按自家风险阈值延后发布,机制主体、约束尺度、解除方式、商业后果都不一样。但它们指向同一个变化:最强的那批模型,训练完直接上架的日子,正在结束。不是外面有人审,就是里面先设闸。
最有意思的细节在这。奥特曼嘴上说过,把顶尖模型局限在少数人手里并不是个好策略;手上却亲手把 Astra 锁在少数人的环境里。这一幕不叫打脸,叫流程压过了立场。至少在 Astra 这件事上,安全流程跑赢了公司的扩张本能。
所以我的判断是:别把 OpenAI 这次动作捧成道德觉醒,也别踩成惜售营销。它值钱的地方在形态:安全从一句口头禅,变成了一套真会延误自家产品发布、真烧排期的工程流程。流程不会说谎:它不认发布会排期,不认股价,只认评估结果。
这套流程的信誉也有天花板:标准是 OpenAI 自己定的,评多严、卡多狠,外人只能看结果。它值钱,是因为代价是真的。推迟旗舰等于把市场先手让出去,这个代价,没有哪家公关预算能报销。真要验成色,得等它哪次评错了还照按,到那天,这套流程才算立住。
落到你我身上,变化已经开始:以后最强 AI 的发布,会越来越像进一道高风险门禁:先过评估,再解释为什么能放行。它还不是药品审批那种外部监管,但已经不再是训练完就开卖。你等到的每一个新模型,都可能是「审过才放」的版本。这种慢,是这套流程存在的意义。
本文事实来源
- OpenAI 官方博客:《Responding to the next frontier of critical cyber capabilities》(2026-08-07)
- OpenAI 官方 X 账号:Astra 网络安全评估公告帖(2026-08-07)
- IT之家:《OpenAI:因网络安全风险,延缓 Astra 模型发布》(2026-08-08)
- OpenAI:《Preparedness Framework》Version 2(2025-04-15)
- OpenAI:《OpenAI and Hugging Face partner to address security incident during model evaluation》(2026-07-21)
- The Record:《US lifts export controls on Anthropic’s frontier cybersecurity AI models》