OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布

OpenAI 宣布 Astra 在其 Preparedness Framework 下达到"关键级网络安全能力"门槛,是首个被评定为该级别的模型。这意味着在具备合适工具和访问权限的情况下,它能够发现此前未知的安全漏洞,并开发出利用这些漏洞的方法,在众多防护严密的系统中实施攻击,且无需人工逐步引导。

评估结果

  • 在 ExploitBench 基准测试中取得 100% 满分
  • 在内部基准测试中,Astra 使用远少于 GPT-5.6 Sol 的输出 token,实现了更高的任意代码执行成功率,甚至发现并利用了两个零日漏洞
  • 在针对加固浏览器的专家评估中,Astra 发现先前未知的漏洞并转化为可用的漏洞利用链,成功逃逸沙箱并在主机上执行命令
  • 在针对加固操作系统的评估中,发现多个漏洞并组合成从非特权用户到 root 的本地权限提升链

防护措施

  • Astra 能更稳健地拒绝对违规网络协助的请求,在网络越狱评估中拒绝率为 91.5%(对比 GPT-5.6 Sol 的 59%)
  • 对高风险账户采用更保守的模型行为边界
  • 增加了思维链监控,以便快速检测并遏制可能偏离对齐目标的行为

发布安排

高级网络安全工作最初将面向一组测试人员开放,随后通过 Daybreak Blue 逐步扩大访问范围,以拓展防御性用途。