❯ OpenAI 把 GPT-5.6 Sol 装进 Cerebras 芯片,推理速度飙到每秒750个token
速度硬件化据 OpenAI 官方预告,旗舰模型 GPT-5.6 Sol 将于 7 月接入晶圆级芯片厂商 Cerebras 的推理硬件,正式上线后速度可达每秒750个token——比传统 GPU 集群常见的每秒 40 到 120 token 快出一个数量级,初期只开放给少数客户,产能再逐步扩容。
背后的赌注GPT-5.6 Sol 是 6 月 26 日在白宫自愿预部署审查框架下预告的下一代模型。据分析人士 Bleys Goodson 推算,这套服务可能跑在 70到100块 Cerebras 晶圆上、大致一块晶圆对应一层,总参数约 3T、激活约 150B、共 70 层——若这一推算属实,OpenAI 这次不是把模型硬塞进现成硬件,而是围绕硬件反向设计模型。Cerebras 此前已拿下一份据称价值超200亿美元、配套 750MW 推理算力的多年期 OpenAI 合同,且已递交 IPO 申请。
落地的差别速度换来的是应用形态的变化:一个能在 6秒内吐出 4000token 代码补丁的编程 Agent,和一个要等一分钟的版本,根本不是同一种工具。对 Anthropic 而言,这把响应速度做成了一道新的竞争门槛——过去比谁答得对,现在还要比谁答得快,两条赛道叠在了一起,谁掉队都要补课。
signal: GPT-5.6 Sol 这次押注的护城河不是模型智商,是能不能比对手先把响应速度焊进硬件里。