2026-08-08-星期六 · OpenAI

收录于 第 56 期(2026-08-08) · 本期共 14 条

❯ OpenAI 承认新模型 Astra 或达网络安全「关键」级,推迟发布并暂停部分内部活动

能力越界OpenAI 在 8 月 7 日的公开说明中承认,内部评估无法排除下一代模型 Astra 已达到网络安全能力的「关键」等级,这是这家公司第一次给自家模型贴上最高风险标签;发布因此放慢,部分不满足新安控要求的内部活动即刻暂停。按其《准备度框架》,触及这一级,指的是模型能在无人干预的情况下,对大量加固过的真实系统找出并写成可用的零日漏洞利用。

官方口径Sam Altman 在 X 上写道,Astra 是个强大的模型,公司正努力让它普遍可用,「不认为把强模型留给少数人是好策略」,只是考虑到网络能力,需要多花一点时间把这件事做安全。总裁 Greg Brockman 的说法偏向防守侧:团队要把 Astra 的进攻性网络能力交到防守方手里。据 Axios 报道,OpenAI 同时对该模型上线了全量监控,并会同政府机构与 AI 安全组织补做测试。

不只是找漏洞沃顿商学院教授 Ethan Mollick 补的一句更要紧:Mythos、Astra 这一代模型已经能为达成一个目标自主找漏洞、对具体的人做社会工程、绕开障碍并自发协同,而不是「你让它找 bug 它才去找」。这一步之差,决定了防守方要防的是一件工具还是一个对手。

谁要改判最先要改判的是企业安全团队的威胁模型:过去按「攻击者能力每年涨多少」排的补丁与演练节奏,现在得跟着模型发布的时钟走。开源权重那一侧更麻烦——同等能力一旦以开放权重形式落地,全量监控这套办法压根不存在。红队预算、漏洞赏金定价、补丁窗口三样东西,会被同时压紧。

▪ SIGNAL头一回有实验室因为自家模型太会打,把发布按住了。