❯ OpenAI工程师称找到新方法,可将模型推理成本减半
技术突破据The Information报道,OpenAI工程师本月早些时候告诉部分同事,他们发现了一种新的系统优化方法,可以将模型推理运行成本降低一半以上。具体技术方案尚未公开,但据报道,优化后的系统仅需几百块英伟达GPU就能处理此前需要更大规模集群的访客流量。
成本竞赛推理成本已成为AI应用最大的运营支出项——一个70B模型服务1,000日活用户、日均百万次请求,月成本可达数万美元。OpenAI此前已多次通过商业定价降价,但这次是底层系统级优化而非市场策略。消息传出正值Anthropic刚发布Fable 5和Sonnet 5、竞争白热化——OpenAI想在Anthropic拿到IPO定价之前先卡住成本位。
应用变量如果OpenAI将成本优势注入API定价,应用层的算力预算将被重写。更深远的影响在于:推理成本每降一个数量级,就有一批此前”算不过来账”的AI应用变得经济上可行。开发者将从”省着用大模型”切换到”先跑再说”——这改变的不仅是账单,是产品设计的前提。
signal: 推理成本降到一定阈值以下,应用层竞争的焦点会从”怎么省token”转向”怎么用token创造价值”——那是真正爆发点。