2026年10月2日 星期五 · OpenAI · Google · Gemini

收录于 第 108 期(2026-10-02) · 本期共 13 条

11 MODEL

❯ Artificial Analysis:Gemini 4 Argon 综合智能追平 GPT-6 Astra,幻觉率仅 15%

得分持平,幻觉差三倍独立评测机构 Artificial Analysis 发布测试结果称,Google 新模型 Gemini 4 Argon(高推理档)在其综合智能指数上追平 OpenAI 的 GPT-6 Astra(最高推理档)。两者差距在幻觉率:Gemini 4 Argon 为 15%,GPT-6 Astra 为 51%。

幻觉率怎么算Artificial Analysis 的智能指数汇总了编程、代理任务、科学推理等十项测试。幻觉率衡量模型在不知道答案时仍编造内容的比例,数值越低越可靠。该机构 9 月测试 GPT-6 Astra 时已指出,其幻觉率比上一代 GPT-5.6 Sol 的 92% 下降近一半。

企业选型多一个依据对用模型写报告、查资料或处理法律财务文件的企业来说,能力相同时,少编造的模型能省下大量人工核对时间。不过这是第三方在特定测试集上的结果,实际表现还取决于任务类型。Gemini 4 Argon 与 Claude Sonnet 5.5、GPT-6.1 Sol 本周同期上线,在编程代理榜也排名靠前。

▪ SIGNAL前沿模型的智力分数越来越接近,“知道自己不知道”正在成为拉开差距的那个指标。