❯ 开发者拆解 Kimi K3:2.8 万亿参数只激活 1.7%,推理毛利被估到八成
稀疏度拉满独立研究者 zephyr_z9 在 X 上拆解 K3 的服务方式:模型总参数 2.8 万亿,以 fp4 精度部署后实际体积约 1.4 万亿,每个 token 只激活约 1.7% 的参数——按他的说法,这是目前市面上最稀疏的前沿模型。据此推算,Kimi 的推理毛利率在 75% 到 85% 之间。
慢是设计不是缺陷K3 在 7 月发布后 48 小时内就把 Moonshot 的算力压到上限,很多用户随之抱怨响应慢。研究者 teortaxes 在 X 上给出的解释是反直觉的:Kimi 算力极其紧张,只能用极端大的批处理规模去换吞吐,代价就是单次请求的等待变长。同一套取舍带来的结果是,即便硬件效率不如海外同行,它的推理毛利仍可能高于 Anthropic。此前业内普遍把中国模型的低价解释为补贴,而据这两位研究者的公开拆解,K3 的低价就不再是”补贴换份额”的老故事——它是稀疏架构 + 低精度部署 + 大批量调度三件事叠出来的结构性成本优势。需要说明的是,上述参数与毛利均为第三方推算,Moonshot 未披露官方数字。
定价权换了地基这套账直接影响谁的报价单。对做成本模型的应用团队,中国开放权重模型的低价从”随时可能涨回去的促销”变成了可以往三年规划里写的基线;对海外闭源厂商,压力落在毛利结构本身,而不是市场部再打几折就能对冲的地方。稀疏度这个此前只出现在论文里的指标,如今直接决定谁能在同一档价格上活下来。
signal: 把参数堆到万亿只是入场券,敢让 98% 的参数在每次推理时闲着,才是 K3 敢定这个价的真正底气。