2026-10-01-星期四 · Gemini4 · Google · OpenAI

收录于 第 107 期(2026-10-01) · 本期共 14 条

01 MODEL

❯ Google 发布 Gemini 4 Argon,独立测评追平 GPT-6 Astra,幻觉率只有后者三成

先给网络防御者用Google DeepMind 发布新一代前沿模型 Gemini 4 Argon,主打复杂编码、法律和金融等企业知识工作,以及网络安全防御。它今天先开放给政府和受信任的网络安全团队,Google 称会根据早期测试反馈加固系统,再尽快扩大开放范围。

和 Astra 打成平手独立评测机构 Artificial Analysis 的测试显示,Argon(高推理档)在其智能指数上与 GPT-6 Astra(最高档)持平,幻觉率却只有 15%,Astra 为 51%。幻觉率衡量模型在不知道答案时编造内容的比例。Argon 单次回复最多可输出 100 万 Token,约为 Astra、Claude Opus 5.5 上限的 8 倍,适合一次性完成很长的多步骤任务。

跑分之外的疑问据 Bloomberg 报道,部分 Google 员工认为 Argon 跑分出色,但在一些真实编码任务上表现吃力,Google 否认这一说法。它先只给安全领域的少数客户使用,也说明 Google 对强能力模型的滥用风险格外谨慎,这与 Anthropic 限量开放 Mythos Preview 的做法相似。

三家又挤到一起过去一年,前沿模型的领先位置主要在 OpenAI 和 Anthropic 之间轮换。Argon 让 Google 重新回到第一梯队,企业挑选主力模型时多了一个可比的选项。低幻觉率对法律、金融这类答错代价高的场景尤其有吸引力,也是 Google 正面挑战两家对手企业生意的切入点。

▪ SIGNAL当几家模型的综合分数打平,“少说错话”可能比“多答对一题”更能打动愿意付高价的企业客户。