-
aaideit_admin 管理员
OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布
OpenAI 宣布 Astra 在其 Preparedness Framework 下达到"关键级网络安全能力"门槛,是首个被评定为该级别的模型。这意味着在具备合适工具和访问权限的情况下,它能够发现此前未知的安全漏洞,并开发出利用这些漏洞的方法,在众多防护严密的系统中实施攻击,且无需人工逐步引导。
评估结果
- 在 ExploitBench 基准测试中取得 100% 满分
- 在内部基准测试中,Astra 使用远少于 GPT-5.6 Sol 的输出 token,实现了更高的任意代码执行成功率,甚至发现并利用了两个零日漏洞
- 在针对加固浏览器的专家评估中,Astra 发现先前未知的漏洞并转化为可用的漏洞利用链,成功逃逸沙箱并在主机上执行命令
- 在针对加固操作系统的评估中,发现多个漏洞并组合成从非特权用户到 root 的本地权限提升链
防护措施
- Astra 能更稳健地拒绝对违规网络协助的请求,在网络越狱评估中拒绝率为 91.5%(对比 GPT-5.6 Sol 的 59%)
- 对高风险账户采用更保守的模型行为边界
- 增加了思维链监控,以便快速检测并遏制可能偏离对齐目标的行为
发布安排
高级网络安全工作最初将面向一组测试人员开放,随后通过 Daybreak Blue 逐步扩大访问范围,以拓展防御性用途。