❯ GPT-6 Astra 博客撤下重发,幻觉率等多项跑分反复调整引刷榜质疑
发布波折OpenAI 于当地时间 9 月 3 日发布 GPT-6 Astra 的公告,过程一波三折:博客发布后被撤下,页面长时间无法正常访问,官方先后归因于内容管理系统故障与互联网中断,并强调撤稿与基准测试成绩无关。但博客重新上线后,多项评测数据出现了反复调整。
数字变动据《财富》比对页面存档,Astra 的幻觉率先从 4.2% 腰斩到 2%,随后又被调回 4.2%;前代 GPT-5.6 Sol 的同一指标从 12.2% 降到 9.4%,最终也回到 12.2%。变动最大的一处是 Sol 在内部版 ExploitBench 上的成绩,从首版的 5.5% 一路提到 11.5%,OpenAI 事后表示正考虑改回 5.5%,因为 11.5% 对应的推理档位并未商用开放。部分调整甚至发生在博客首次发布之前。
争议焦点OpenAI 的解释是,这些调整是为确保数据代表模型可用性能的最佳估计,测试条件等因素会影响结果。但系统卡并未把评测方法讲清楚——以内部幻觉基准为例,系统卡「几乎没给任何评测细节」。这把 AI 行业长期存在的基准测试可信度争议再次推到台前,此类争议此前也在 Meta 等公司身上出现过。业内呼吁形成规范:修改成绩时必须同时说明评测条件的变化。
两种反应与质疑并行的是华尔街的另一种读法:高盛 Delta-One 交易台主管 Rich Privorotsky 在研报中盛赞 Astra 对产业的重要性,认为「一款领先大模型真正脱颖而出」正是 AI 牛市论调一直在等的东西。要重新掂量的是依赖跑分做选型与投资判断的人——当同一份公告里的数字在三天内改了两轮,客户与投资人很难判断模型是否适配,OpenAI 的市场叙事也跟着多了一道折扣。
▪ SIGNAL数字改了两轮又改回来,损失的不是那几个百分点,是往后每一份官方跑分的可信度。