2026-07-30-星期四 · OpenAI

收录于 第 47 期(2026-07-30) · 本期共 12 条

❯ OpenAI 称 GPT-5.6 Sol 自主重写内核,端到端推理成本降 20%

自我优化OpenAI 联合创始人 Greg Brockman 公布,GPT-5.6 Sol 通过改写生产环境的 GPU 内核,把公司端到端的模型服务成本压低了 20%。这不是实验室里的基准测试成绩,而是已经跑在生产上的结果。开发者 Simon Willison 顺手算了笔账:以 OpenAI 目前的调用体量,这个比例对应的是每月数十亿美元级的支出差额。

它到底做了什么据 OpenAI 官方说明,具体的活分两块。一块是内核:此前 GPT-5.6 就被专门训练来写和改进 Triton 与 Gluon 这两种由 OpenAI 维护的开源 GPU 编程语言的代码,这部分与更广泛的内核改进合起来构成了那 20%。为了确认模型写出来的东西真的没错,OpenAI 押了不少精力在验证工具上,包括开源的浮点行为检查工具 FpSan。另一块更接近「模型改模型」:Sol 自己动手改进了投机解码所用的草稿模型,设计并跑完了数百次架构实验,在尺寸、结构、特性三个维度上逐个试,训练途中还自主处理了硬件故障与训练不稳定;最终把令牌生成效率提高了 15% 以上。

成本来源变了过去几年推理降价主要靠三件事:新一代加速器、量化与蒸馏、以及规模摊薄。现在多了第四件,而且这件事不受硬件交付周期约束——模型厂商的降价节奏从此可以脱离新卡上架的时间表。做长期成本测算的应用团队要改的正是这个假设:调用单价的下降不再只跟着英伟达的产品周期走。对其他实验室来说压力更直接,谁的模型不会优化自己的推理栈,谁的毛利就要靠贴钱撑。

▪ SIGNAL递归自我改进第一次不在论文里,而在一张月度账单上。