2026-09-19-星期六 · GLM5_3FlashX

收录于 第 96 期(2026-09-19) · 本期共 11 条

❯ 智谱上线 GLM-5.3-FlashX:推理速度提至每秒 200 个词元,价格为基础版 2.5 倍

速度版本据智谱公告,公司已开放 GLM-5.3-FlashX 应用程序接口,峰值输出速度达到每秒200 个词元,约为 GLM-5.3-Flash 的五倍。模型延续 100 万词元上下文及多模态输入,主要差异落在服务速度和计费层。

花钱买时延作为与基础版的对比,智谱公布的 FlashX 输入与输出价格分别为每百万词元2 元和 7 元,约为基础版的2.5 倍。用 2.5 倍价格换五倍速度,对实时客服、语音交互和高并发智能体可能划算;离线批处理若不赶时间,基础版仍有更低单位成本。企业还要核对并发额度与峰值时段服务承诺,才知道这笔溢价能否稳定换回等待时间。

采购选择开发者现在可以在同一模型家族内直接给时延定价,无需为了更快响应更换模型并重新评测智能水平。实际收益还取决于首词延迟、并发限额和高峰期吞吐,公告所称峰值每秒 200 个词元不能自动等同于线上稳定速度。先做真实流量压测,再决定哪些请求需要切到高速版本,会比全量迁移更省钱。

▪ SIGNALFlashX 卖的不是更聪明的模型,而是可计价的等待时间;实时产品多花的钱,必须由更高完成率或更多并发收回来。