2026-08-25-星期二 · 英伟达

收录于 第 72 期(2026-08-25) · 本期共 15 条

❯ 英伟达 Groq 3 LPX 量产,10 万 token 长上下文实测每秒 3400 token

量产与实测据英伟达公告,专用推理加速器 Groq 3 LPX 进入全面量产。在 Artificial Analysis 的标准测评中,它运行开源模型 Gemma 4 31B、带 10 万 token 活跃上下文时,输出速度达到每秒 3400 个 token,是同等长上下文条件下次优平台的 4 倍,也是该模型迄今被记录到的最快成绩。单机架最多可装 256 颗 LPU,配 128GB 高带宽 SRAM。

八个月的伏笔这颗芯片的定位是给 Vera Rubin NVL72 平台做补充,专攻智能体那种需要长时间持续吐 token 的负载。更值得记的是时间线:据 The Register 报道,距离英伟达拿下 Groq 的非独占技术授权已经过去八个月,这是 Groq 的技术第一次出现在英伟达的机架级产品里。云厂商 Nebius 是首家部署方,通过其 Token Factory 服务对外提供。

推理侧分工训练和推理正在被拆成两条独立的硬件产品线,长上下文下的每秒出词速度成了可以单独定价的指标。先松动的是智能体产品的响应时延预算:一个要连续调用几十轮工具的智能体,此前受生成速度所限只能做成异步交互,速度提到这个量级,同步实时的产品形态才第一次站得住,单位任务的推理成本也跟着重算。

▪ SIGNAL据 The Register 报道,那笔约 200 亿美元的授权,第一次有了能被基准测试记录下来的形状。