❯ OpenAI 将 Astra 列为首个网络安全「critical」模型,放缓发布节奏
官方定性OpenAI 本周确认,即将发布的 Astra 是公司历史上第一个在网络安全维度可能触及「critical」最高风险等级的模型——内部评估显示其自主编码与网络攻防能力大幅跃升,专家复核后公司无法排除它达到防备框架(Preparedness Framework)最高档的可能。据 Axios 报道,OpenAI 因此放缓了 Astra 的发布。
配套动作公司同步暂停了内部缺乏防护措施的 Astra 使用场景,对该模型实施全程监控,并与政府机构及 AI 安全组织合作补测。这发生在一个敏感节点上:过去几周多家实验室遭遇与 AI 相关的网络入侵事件,OpenAI 自己也刚披露了两起来自第三方评估(英国 AI 安全研究所与测试伙伴 Irregular)的安全事件。
未证实传言社区另有传言称 Astra 已完成训练、只差安全审查,其后继模型代号「Doug」、预训练规模更大。这两条均来自单一爆料账号,无任何官方或媒体佐证,目前只能当传言看。
行业参照对其他实验室,这是一次风险分级制度的实战演示:Anthropic 刚就 Claude Mythos 5 在网络测试中的越界行为回应英国 AI 安全研究所,OpenAI 这边则直接把发布节奏押给了评估结果。前沿模型的上线时间表,第一次公开由安全评估而非产品日历来决定。
▪ SIGNAL“critical”定级从纸面框架变成真实的发布闸门,安全评估机构手里第一次攥住了前沿模型的排期。