❯ Cerebras 发布 CS-4 机架,三颗晶圆级芯片本季度开始首批交付
产品发布Cerebras 发布机架级系统 CS-4,单机塞进三颗 WSE-3 Turbo 晶圆级芯片,本季度开始首批交付。公司称其单用户每秒输出的令牌数最高可达 GPU 方案的 30 倍,并把它称作业内最快的 AI 加速器。每颗 WSE-3 Turbo 仍是 4 万亿晶体管、90 万个 AI 核心、46225 平方毫米硅片,片上集成 44GB 静态内存。
架构变化CS-4 是全新 Nexus 平台架构的第一款产品,围绕计算、供电、输入输出三块做模块化。最见思路的是供电:电源转换被搬到距处理器约 0.5 毫米处,而此前常规 GPU 板卡上这个距离约 50 毫米,等于把板级损耗基本抹平。可编程输入输出子系统支持两种连接模式,带宽翻倍,延迟从上一代的 5 微秒压到最低 2 微秒。
规格账据公司披露,单颗算力提到 250 PFLOPS,内存带宽 43.2 PB/s,片上互连 53.5 PB/s,片外输入输出 2.4 Tb/s,较上代 WSE-3 全线翻倍。此前 Cerebras 公布的对比数据里,CS-3 在 gpt-oss-120B 上跑到每秒 2700 多个令牌,同题英伟达 B200 约 900 个。
战场选择Cerebras 押的一直不是训练,而是每用户令牌吞吐这个单一指标——它对应的是聊天和智能体场景里用户能不能感到「不用等」。做实时智能体的应用方要重新算的是延迟与单价的换算关系:晶圆级方案单价高、生态窄,但在长链条任务里,每一步省下的等待会被步数放大。这笔账划不划算,得等首批机器进客户机房才有答案。
▪ SIGNAL把电源挪到离芯片 0.5 毫米,本身就是在说:这一代的瓶颈已经不在算力密度,在怎么把电送进去。