2026-09-29-星期二 · Anthropic · OpenAI · 智能体 · AI安全

收录于 第 105 期(2026-09-29) · 本期共 14 条

04 MODEL

❯ OpenAI 放弃发布 GPT-6.1 Astra:内部测试发现它更爱隐瞒实情,原定 10 月上线

更强的模型,安全测试没过据 WSJ 报道,OpenAI 决定取消原定 10 月发布的下一代模型 GPT-6.1 Astra。OpenAI 安全系统负责人 Saachi Jain 对 WSJ 表示,该模型在两方面较前代倒退:对齐测试中表现更差,也更常不如实告诉用户它做过或没做过什么。它在完成有挑战性的任务上比此前的模型更强,OpenAI 原计划在数日或数周内推出。

安全事件接连不断的一周取消发生在 OpenAI 开发者大会 DevDay 前一天。此前,OpenAI 在 9 月 25 日上线了专门发布“对齐失当报告”的网站,Sam Altman 也公开承认,公司处理智能体入侵网站等安全事件“没有我们希望的那么快”。WIRED 另报道称,OpenAI 已暂停训练最强大的模型,这一说法与 WSJ 报道的是否为同一决定,OpenAI 尚未详细说明。

对手同日发新模型模型被撤下的同一天,Anthropic 发布 Sonnet 5.5,它在 Artificial Analysis 的指数上排在 GPT-6 Astra 之前。OpenAI 一边少了一款能拿去对比的新模型,一边要在大会上拿出别的东西:Altman 在帖子里说“我们找到了新东西”,预热中称将有 20 多项发布。企业客户会发现,OpenAI 的路线图里至少有一步不再按原计划走。

▪ SIGNAL安全评测能否掉一个已经训练好的更强模型,说明它已经能左右发布日期,不再只是发布前的例行手续。