❯ Kimi K3 需求挤爆算力,Moonshot 暂停新订阅并被曝筹备香港 IPO
[卖到关门] Moonshot AI 在官方账号宣布暂停新订阅,理由是 Kimi K3 发布后 48 小时内需求已逼近现有算力上限,同时重做了套餐分层;已订阅用户不受影响。这是这轮中国模型热潮里少见的”卖爆到关门”——公司称会先扩容,再分批放新用户进来,而不是一次性重开闸门。K3 是一个 2.8 万亿参数的开放权重模型,上下文窗口最高 100 万 token,主打长周期编码、复杂推理与多模态。
[估值与账本] 更硬的一组数字来自彭博:Moonshot 已向投资人吹风,最快六个月内在香港上市,同时正在收尾的一轮融资可能把这家成立三年的公司估到300 亿美元以上。收入侧同样陡峭——年化经常性收入六月已达 3 亿美元,四月还只有 2 亿美元,两个月增长 50%。据报道公司已向股东分发了支持上市的决议文件。要注意的是,融资估值与上市时间表均出自知情人士口径,Moonshot 本身没有公开确认,最终以招股材料为准。
[算力是天花板] 暂停订阅这个动作,把中国模型公司真正的瓶颈摆到了桌面:不是有没有人用,而是有没有卡供着人用。Kimi 的 GPU 大量来自阿里云,而阿里自家的 Qwen 团队同样在抢这批资源。对准备接入 K3 的应用开发者来说,选型时要多算一项:这家供应商在需求峰值下会不会关闸,SLA 能不能扛住。上市募资的直接用途,多半就是把这堵算力墙往后推。
signal: 一家模型公司最先撞上的天花板不是需求,是机柜;关掉注册按钮比任何跑分都更能说明 K3 卖成了什么样。
❯ 开发者拆解 Kimi K3:2.8 万亿参数只激活 1.7%,推理毛利被估到八成
[稀疏度拉满] 独立研究者 zephyr_z9 在 X 上拆解 K3 的服务方式:模型总参数 2.8 万亿,以 fp4 精度部署后实际体积约 1.4 万亿,每个 token 只激活约 1.7% 的参数——按他的说法,这是目前市面上最稀疏的前沿模型。据此推算,Kimi 的推理毛利率在 75% 到 85% 之间。
[慢是设计不是缺陷] K3 在 7 月发布后 48 小时内就把 Moonshot 的算力压到上限,很多用户随之抱怨响应慢。研究者 teortaxes 在 X 上给出的解释是反直觉的:Kimi 算力极其紧张,只能用极端大的批处理规模去换吞吐,代价就是单次请求的等待变长。同一套取舍带来的结果是,即便硬件效率不如海外同行,它的推理毛利仍可能高于 Anthropic。此前业内普遍把中国模型的低价解释为补贴,而据这两位研究者的公开拆解,K3 的低价就不再是”补贴换份额”的老故事——它是稀疏架构 + 低精度部署 + 大批量调度三件事叠出来的结构性成本优势。需要说明的是,上述参数与毛利均为第三方推算,Moonshot 未披露官方数字。
[定价权换了地基] 这套账直接影响谁的报价单。对做成本模型的应用团队,中国开放权重模型的低价从”随时可能涨回去的促销”变成了可以往三年规划里写的基线;对海外闭源厂商,压力落在毛利结构本身,而不是市场部再打几折就能对冲的地方。稀疏度这个此前只出现在论文里的指标,如今直接决定谁能在同一档价格上活下来。
signal: 把参数堆到万亿只是入场券,敢让 98% 的参数在每次推理时闲着,才是 K3 敢定这个价的真正底气。
❯ 阿里发布 2.4 万亿参数 Qwen3.8-Max 预览版,称将很快开源权重
[赶在 K3 之后] 阿里通义千问团队发布 Qwen3.8-Max-Preview,参数量 2.4 万亿,官方自评”对标各家前沿模型、仅次于 Claude Fable 5”,并称完整版很快会开放权重。发布落在上海世界人工智能大会期间,距离 Moonshot 的 Kimi K3 开源发布只隔了几天。这是通义团队首个参数量超过 1 万亿的多模态模型,可处理文本、图像、视频与文档。
[跑分表还没出] 目前预览版已在阿里云和 Qwen Chat 上线可测,并被打包进新推出的 Token Plan 订阅——从每七天 2500 点数的 6 美元 Lite 档,到 4 万点数的 68 美元 Pro 档。但有一个必须说清的空白:阿里没有公布任何第三方基准测试、模型卡或许可证,“仅次于 Fable 5”完全建立在自家内部评测上。同为稀疏专家混合架构,官方也没有披露每 token 的实际激活参数量——而这恰恰是判断服务成本的关键。评论区已有人指出,在跑分表出来之前,这个排名只能算厂商声明。
[先占位再验货] 这种”先放话、后交卷”的节奏本身透露了竞争强度:K3 刚把开放权重的标杆抬高,阿里就必须在同一周给出回应,哪怕手里只有一个预览版和一句自评。对准备做选型的技术负责人,合理动作是把 Qwen3.8 放进候选池但不动架构,等权重和许可证落地再测;对同赛道的国产模型团队,参数量这个数字已经被推到 2.4 万亿这一档,下一家出牌的门槛跟着抬高了。
signal: 没有跑分表的第一名,含金量取决于权重什么时候真的放出来——在那之前,这条新闻的主语是发布会,不是模型。
❯ 研究者 Nathan Lambert 提出猜测:阿里最强模型转开源,可能有自上而下的推力
[一个未证实的推测] 人工智能研究者 Nathan Lambert 在 X 上指出一个反常处:通义千问近来最大的那几个模型从来没有开放过权重,这次 Qwen3.8 却预告要开源,“有什么正在变”。他随后给出一个带有政策色彩的猜测,并明确标注这只是”示意,不是事实”。转述时必须保留这层边界:目前没有任何公开文件或官方表态支持这一推断。
[算力是同一笔账] 分析者 Kevin S. Xu 补上的产业关联更可核查:阿里是 Moonshot 的主要投资方,而 Kimi 又占用了阿里云相当大一块 GPU 资源,时常与通义团队争抢同一批卡。十天前阿里预告季度业绩时称,阿里云增速在 40% 以上——那还是 K3 引爆之前的口径。最近一个完整季度里,阿里云智能集团收入同比增长 38%,外部客户收入增长 40%,人工智能相关产品已占云业务收入约三成,并连续十一个季度保持三位数增长。K3 的意外爆发,正好落在这条曲线的下一个统计窗口里。
[两条战线] 于是阿里同时站在两侧:既是 Qwen 的开发者,又是竞品 Kimi 的股东兼算力供应商。Kimi 卖得越猛,阿里云的账面越好看,通义团队能分到的卡就越少。对看阿里财报的投资者,云业务增速这个指标此后要拆开读——多少来自外部客户的真实上量,多少来自自家生态里模型公司的互相挤占。
signal: 押注一整个赛道的好处是总有一边赢,代价是自己内部要先分出输赢。
❯ 阿里芯片部门平头哥在世界人工智能大会开源 SAIL 软件栈,直指英伟达 CUDA
[软件先动] 阿里芯片设计部门平头哥在上海世界人工智能大会宣布,把旗下镇武系列人工智能芯片的基础软件架构 SAIL 全套技术栈当日起向全球开发者免费开放。目标很直白:削弱英伟达 CUDA 生态的锁定效应。
[不是第一家] 这一步接在华为和摩尔线程之后。摩尔线程此前推出自研的 CUDA 替代方案 MUSA,并配套 Musify 工具包用于迁移已有 CUDA 代码,其旗舰芯片也已宣布兼容阿里的模型。国产 GPU 厂商这两年逐渐形成共识:硬件参数追赶的速度,远快于开发者迁移的速度,真正卡住替代进程的从来不是算力峰值,而是一整套编译器、算子库和调试工具。开源是把迁移成本从买方转移到卖方——你不肯换,那我把工具链白送。
[工具链决定份额] 这轮开源比较务实的一点,是同时对国际开发者开放,而不只服务国内客户。对在国产卡与英伟达之间做取舍的基础设施团队,评估维度要从”这张卡跑多快”换成”我现有的算子迁过去要花几个人月”。国产芯片能不能在英伟达之外咬下一块,决定权更多握在写编译器的人手里,而不是流片车间。
signal: CUDA 的护城河从来是二十年沉淀的开发者习惯,几家中国厂商同时开源工具链,等于第一次组队去填这条河。
❯ 中国芯片公司壁仞押注光互连超节点,把单集群规模推到 1024 张加速卡
[铜线到头了] 国产 GPU 公司壁仞在世界人工智能大会提出一套光互连”超节点”架构:传统铜缆电气连接已撞上物理极限,把当前架构实质限制在单机 128 张 GPU;壁仞改用近封装光学方案,把光纤挪到更靠近芯片的位置,据称可支撑单集群 1024 张加速卡——规模提升八倍。
[同题竞速] 据南华早报报道,同场提出下一代光互连超节点设计的还有沐曦,两家的方案都指向 1024 张 GPU 共享同一片内存空间。这条路线的现实前提是,在先进制程受限的情况下,中国厂商很难在单芯片性能上正面追平英伟达,于是把突破口挪到”把更多颗弱一点的芯片连成一个更大的整体”。华为、阿里等公司在本届大会上展示的多套”芯片粘合”式超级计算机,走的是同一个思路。此前壁仞刚在香港启动首次公开发行,这套架构也是它面向资本市场的核心叙述之一。
[互连成为新战场] 训练一个万亿参数模型,卡与卡之间的带宽往往比单卡算力更早成为瓶颈——这也是英伟达把 NVLink 攥得那么紧的原因。如果 1024 卡共享内存的方案能在真实训练任务上跑通,国产集群的可用规模会跨过一个此前迈不过去的门槛。对规划国产算力集群的机构用户,此后要盯的不再是单卡算力对比表,而是互连带宽与集群实测效率。
signal: 单颗芯片追不上,就把连接方式换掉——中国算力的突围口正在从晶体管挪到光纤。
❯ Anthropic 把 Claude Fable 5 并入 Max 套餐,只给 50% 额度,Pro 用户改用点数
[额度里切一半] Anthropic 官方账号宣布,自 7 月 20 日起,Claude Fable 5 正式并入所有 Max 与 Team Premium 套餐,但按订阅额度的 50% 计——不是在原额度之上加量,而是从现有额度里划出一块专供 Fable 5。按官方举例,一个每周 100 次提示的套餐,其中最多 50 次可以调用 Fable 5,其余必须走别的 Claude 模型。
[推向按量] 更低档位的处理方式不同:Pro 与 Team Standard 用户不再通过每周额度使用 Fable 5,而是改走用量点数,并获得一次性 100 美元点数补贴。此前自七月初以来,Fable 5 的开放一直以临时试用期形式数次延期,这项安排取代了那套过渡办法——Anthropic 的说法是,Fable 的需求难以预测,因此一直随着算力到位分阶段放开。换句话说,试用期结束了,账开始真算了。
[分层收费] 这套设计把订阅制里一直含糊的部分挑明:最强模型不再是”订阅了就随便用”,而是套餐里一项被单独计量的稀缺资源。对把 Claude 写进工作流的团队,接下来做预算要按模型分开算,把 Fable 5 留给真正吃能力的环节,其余任务下沉到便宜模型。参照前一条 Kimi 的成本拆解,两边正好构成对照:一边在用稀疏架构把边际成本往下压,一边在用额度切分把稀缺性明码标价。
signal: 当旗舰模型要从额度里单独划一块出来,订阅制就已经在往按量付费迁移了。
❯ 世界杯决赛把预测市场推上纪录,两大平台六月总成交首破 500 亿美元
[纪录被冲掉] 据《纽约时报》报道,Kalshi 与 Polymarket 上围绕国际足联世界杯决赛的投注额突破 56.9 亿美元;数据平台 Dune Analytics 称,两个平台的总成交额在六月首次越过 500 亿美元。作为参照,Kalshi 单月名义成交约 310 亿美元,较五月跳涨逾 70%,其中体育类合约占到约 85%。
[从政治盘到体育盘] 预测市场此前主要靠选举盘拿流量,这届世界杯把它彻底推进体育博彩腹地——有统计称赛事期间预测市场已吃下体育投注约 27% 的份额,正面挤压传统体育博彩公司。与人工智能的接口也已经出现:ChatGPT 的搜索结果开始整合 Kalshi 的世界杯赔率,把实时概率直接喂进对话界面。同时监管压力在另一头累积,多个州正推动将相关业务列为重罪的立法。上述各家统计口径不一,交叉比较时需注意来自平台自报还是链上数据。
[概率变商品] 对做信息类产品的团队,这批实时概率是一类新的结构化数据源——比民调快、比社交媒体的情绪指标干净,而且天然带着定价。真正的关卡在监管:一旦某个州把体育合约认定为博彩,接进产品里的赔率接口就得连夜下线,而这类立法进程往往只有几周的缓冲期。
signal: 当聊天机器人开始把赔率当搜索结果返回,预测市场就从赌场变成了基础设施——监管接下来要处理的正是这个身份切换。