❯ OpenAI 把免费版默认模型换成 GPT-5.6 Luna,并开放无限文本对话
[免费档变天] OpenAI 把 ChatGPT 免费档的默认模型换成 GPT-5.6 Luna,并从下周起给免费用户开放无限文本对话——这是 ChatGPT 上线三年来免费档第一次拿掉对话条数上限。同步落地的还有一个 Think 按钮,遇到难题可手动切进推理模式。据 Axios 记者 Herb Scribner 报道,文件上传和图片生成的额度限制仍然保留。
[付费档同步] 付费一侧同时更新:Plus 与 Pro 用户的 Instant 和 Thinking 两条路径统一切到改进版 GPT-5.6 Sol,并新增一个思考强度滑杆,让用户自己决定单次回答烧多少推理算力。Sam Altman 当天在 X 上确认「5.6 Sol 在聊天场景好了很多」,Greg Brockman 则把这轮更新归到「让产品随时间变得更简单」的路线上。这一步的前因并不复杂:过去一年免费档的次数墙一直是 ChatGPT 相对 Gemini 免费层和国内几家免费应用最明显的短板,而 Luna 这一代小模型的单位推理成本已经压到可以不计次数放开的水平。
[竞争面] 真正被这次调整改写的,是免费 AI 助手的获客成本基准。做消费级 AI 应用的团队此前普遍靠「免费额度更大方」这一条切用户,现在这条护城河被 OpenAI 一次性填平。思考强度滑杆则把推理预算的决定权部分交给了用户,等于承认「一刀切的默认推理档」在成本和体验上都不是最优解——这个设计大概率会被跟进。
▪ SIGNAL 免费档取消次数墙,等于 OpenAI 用推理成本的下降换分发,把竞品最好用的那张牌收走了。
❯ 彭博报道称 OpenAI 首款硬件是冰球大小的智能音箱,定档 2027 年、售价 300 美元以上
[形态曝光] 据彭博社记者 Mark Gurman 报道,OpenAI 首款硬件是一台没有屏幕的甜甜圈形智能音箱,大小约等于一只冰球,可单手拿着在家里走动,定价300 美元以上(另有报道给出 300 至 400 美元区间),发布定在 2027 年。
[设计细节] 设备由 Jony Ive 的 LoveFrom 团队参与设计,用金属等高成本材料,带电池、摄像头传感器和动态灯效,还有可活动的机械部件——目的是让它显得有”个性”,而不是一只被动应答的音箱。OpenAI 希望今年内先把产品对外亮相,明年才正式开卖。对照 2024 年收购 io 时的高调,这个形态其实相当保守:既不是眼镜也不是挂件,落回了亚马逊和谷歌打了十年的桌面音箱品类。
[赛道判断] 这台音箱替智能音箱厂商问了一个问题:一个够聪明的模型能撑起多少硬件溢价。亚马逊 Echo 和谷歌 Nest 长期把价格压在 50 美元档,OpenAI 一上来就要 300 美元以上,赌的是对话质量本身可以支撑六倍价差。这个赌注要到 2027 年才见分晓,中间还隔着一整轮硬件供应链涨价。
▪ SIGNAL 六倍于 Echo 的定价,是把「模型好不好」直接摆上了消费电子的价签。
❯ DeepSeek 后台公告称 API 将大幅涨价,国产大模型低价时代出现拐点
[官方公告] DeepSeek 在用户后台挂出通知,称近期将整体大幅上调 API 定价,具体幅度和生效日期都未披露,只说以后续正式通知为准。这家把国产大模型价格打到地板的公司,第一次主动往回收价——此前它的 V4-Flash 输出价低到每百万 token 仅 2 元,命中缓存的输入价甚至只有每百万 token 0.02 元。
[前因] 涨价不是突然起意。低价换来的是难以承接的调用量:单个模型的周调用量一度超过数十万亿 token、多次位居全球第一,代价是工作日高峰期接口频繁超时和卡顿。7 月中旬 DeepSeek 已经先做过一次试探,上线分时定价——工作日 9:00 至 12:00 和 14:00 至 18:00 两个高峰段价格翻倍,低谷时段和周末维持原价。这次是把分时的补丁换成整体调价。研究者 teortaxesTex 在 X 上给出的判断是,如果 DeepSeek 同时在 API 上放开视觉能力,涨价就有对得起的东西——它的图像理解已经够用,而缓存机制让这部分的成本效率非常高。
[谁先挨打] 先被打到的是把 DeepSeek 当默认后端的中小开发者:过去一年大量应用的成本模型建立在”token 便宜到可以不算”这个前提上,这个前提正在失效。大模型 API 的定价逻辑由此从「烧钱换规模」切回「按算力算账」,而这恰恰发生在 Kimi K3、Qwen3.8-Max 等对手把每任务成本压得更低的节点上。国产大模型的价格战未必就此结束,但靠亏损维持的那一段已经走完。
▪ SIGNAL 价格屠夫自己抬价,说明支撑低价的那本账已经算不平了。
❯ AMD 收购多伦多芯片初创 Taalas,把模型权重直接蚀刻进硅片
[交易落定] AMD 于 8 月 6 日宣布已达成收购多伦多芯片初创 Taalas 的最终协议,交易金额未披露。Taalas 的做法很极端:把模型权重直接蚀刻进硅片,不经过高带宽内存加载,官方口径称推理性能可以提升一个数量级以上。这是 AMD 继数周前的 Cerebras 交易之后,又一笔押在推理侧的收购。
[技术与代价] 目前 Taalas 的芯片分成两块——权重固化在掩模只读区,KV 缓存和微调适配器放在 SRAM 区。一百多层里只有两层需要随模型设计改动,公司称用自研工具流片周期约两个月。代价同样直白:一颗成品只能跑它被造出来时的那个模型,换模型就得换硅片。其第二代 HC2 芯片计划把可承载参数量提到 200 亿。AMD 的整合思路是让 Taalas 芯片与 Instinct GPU 并肩工作,接进 Helios 机架和 Epyc 平台,统一走 ROCm 软件栈。
[产业含义] 这笔收购真正下注的是推理成本的结构:只要模型迭代速度慢下来,把权重焊死在硅片上就能省掉最贵的那部分——高带宽内存。而当下 HBM 正是全行业最紧缺的物料。做推理服务的云厂商要开始考虑一个新问题:哪些模型稳定到值得为它单独开一次流片。答案越多,通用 GPU 在推理场景的份额就被切走越多。
▪ SIGNAL 把权重焊进硅片,赌的是模型迭代终将放慢——AMD 愿意先押一次。
❯ 报道称英伟达评估下调 Rubin Ultra 显存配置,以应对高端 HBM 短缺
[配置缩水] 据多家供应链媒体报道,英伟达正在评估下调下一代旗舰 GPU Rubin Ultra 的显存配置,已并行测试至少三个版本,部分版本的显存规模低于此前公布的规格。原计划是全系采用 HBM4e 12hi,现在 HBM4e 8hi、HBM4 12hi、HBM4 8hi 等低配方案都进了评估表。
[供需缺口] 影响是可量化的:维持顶配方案时 I/O 速度可从上一代的 8 至 11.7Gbps 提到 14 至 16Gbps,若被迫改用 HBM4 低配,增幅可能只到 11 至 12Gbps。缩水的根子在供给——2027 年 HBM 出货容量预计同比增长 50% 至 60%,仍填不上 AI 算力需求的缺口,而最先进的 HBM4e 12hi 在验证进度和量产良率上都还有不确定性。这条短缺链条已经外溢到消费端:内存芯片涨价推高整机成本,苹果等公司已经上调硬件售价。
[连锁反应] 显存缩水不等于性能腰斩,可以靠别的方式补,但账要重算:跑大模型的 AI 企业在单卡显存变小之后,同样的模型需要调用更多张芯片才装得下,单位算力的采购成本会被抬上去。数据中心的采购预算因此要在”卡数”和”卡的规格”之间重新配比——过去两年习惯的按卡数线性外推的算法不再成立。
▪ SIGNAL 连英伟达都得在自家旗舰上让步,内存才是这一轮算力扩张真正的限速环节。
❯ The Information 称 Stripe 已就收购 OpenRouter 进入独家谈判,估值接近 100 亿美元
[交易进展] 据 The Information 报道,支付公司 Stripe 已就收购模型路由平台 OpenRouter 进入独家谈判,交易结构为现金加股票,作价接近 100 亿美元。参照系很扎眼:OpenRouter 在 2026 年 5 月刚完成 1.13 亿美元 B 轮,当时估值仅 13 亿美元——三个月,估值涨了近七倍。
[标的与买家] OpenRouter 成立于 2023 年,做的是模型开发商与企业用户之间的中间层:开发者接一次 API 就能比价、调用并随时切换数百个闭源与开源模型。目前它和 Stripe 本就有商业关系——OpenRouter 自己的收款走的就是 Stripe。报道称,另有多家大型科技公司也评估过出价。对 Stripe 而言,这是从支付主业往 AI 基础设施上迈的一步:模型调用正在变成一种高频、按量计费的消费行为,而计量和结算恰好是它的老本行。
[格局] 这笔交易把模型路由层的价值第一次标了价。做模型聚合与网关的创业公司过去被质疑”没有壁垒、迟早被模型厂自己吃掉”,100 亿美元的报价给出了另一种答案:当调用方需要在几十个模型之间比价切换时,中间层就是收费站。模型厂商的议价权会因此被稀释一层——用户越习惯从路由层进入,单一模型的品牌黏性就越弱,定价权会顺着调用量往中间层迁移。
▪ SIGNAL 三个月七倍的估值跳升,标的不是技术,是站在所有模型收费口前面的那个位置。
❯ Qwen3.8-Max 登上智能指数第五、Agentic 指数第一,但成本仍高于 Kimi K3
[跑分出炉] 独立评测机构 Artificial Analysis 的最新结果显示,阿里 Qwen3.8-Max 在智能指数上得 56 分、位列第五,Agentic 指数拿到第一;每完成一个任务的平均成本为 1.14 美元。阿里通义官方账号当天在 X 上确认了这两个名次,数据以该机构公开榜单为准。
[对照组] 但榜单还有另一半:开源权重阵营的领跑者 Kimi K3 比它高 1 分,每任务成本只要 0.86 美元,比 Qwen3.8-Max 低约 25%。也就是说,同一档智能水平上,闭源的这一版并没有换来成本优势。放在国内序列里看,Qwen3.8-Max 的参数规模为 2.4 万亿,K3 为 2.8 万亿,两家已经贴身到用小数点后一位分胜负的位置。
[看点] 要选模型的企业买家现在真正比的是每任务成本,而不是榜单名次。当分差只有 1 分、价差却有 25% 时,排名前后已经不构成采购理由。Agentic 指数第一对阿里是更实在的战果——智能体场景对多轮工具调用的稳定性要求高,这一项拿第一比综合分靠前更能换来订单。
▪ SIGNAL 分差 1 分、价差 25%,采购决策会往哪边倒并不需要犹豫。
❯ MiniMax 开源新一代多模态模型 H3,登顶 Hugging Face 热度榜
[开源落地] MiniMax 于 8 月 3 日正式开源新一代通用多模态生成模型 MiniMax H3,在 Artificial Analysis 的视频编辑能力项上拿到全球第一,热度登顶 Hugging Face 趋势榜,超过此前占据榜首的 DeepSeek V4-Flash。据 MiniMax 官方公告,模型支持最高 2K 分辨率、最长 15 秒、原生立体声的视频生成。
[生态适配] 更值得注意的是开源当天的适配规模:华为昇腾、摩尔线程、沐曦、海光、昆仑芯、天数、壁仞以及 AMD、英特尔等主流芯片厂商,连同 Hugging Face 与多家云端推理平台,同步完成 Day 0 适配;开源 24 小时内接入的国内外合作伙伴超过一百家。资本市场给出的回应同样直接——杰富瑞重申”买入”评级、目标价 1118 港元,花旗、高盛也维持买入,理由集中在 H3 巩固了 MiniMax 在 AI 视频生成上的位置、成本优势有助于拓客与商业化。截至 8 月 5 日收盘,MiniMax 股价涨幅超过 10%,同期还被纳入港股通标的名单。
[竞争维度] 这一轮真正拉开差距的是芯片适配的广度。要在国产算力上跑视频模型的团队过去最头疼的是”模型出来了,卡上跑不动”,Day 0 就覆盖八家国产芯片,等于把落地周期从数月压到当天。开源模型的竞争标准由此从单纯的跑分,转向”有多少家硬件和平台愿意在第一天就跟”。
▪ SIGNAL 八家国产芯片同日适配,比榜单第一更能说明 MiniMax 攥住了什么。
❯ 晚点报道称字节跳动正讨论训练超 5 万亿参数模型,为国内已知最大
[规模跃升] 据晚点报道,字节跳动正在讨论训练一个参数规模超过 5 万亿的模型,超过阿里 Qwen3.8-Max 的 2.4 万亿和月之暗面 K3 的 2.8 万亿,是目前国内已知规模最大的一个。计划仍处早期阶段,最终未必发布。
[人事与路线] 该项目由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作推进。项亮 2016 年加入字节,做过机器学习中台 AML 团队,后转任豆包大模型 Foundation 团队负责人;沈科 2018 年清华毕业后即入职,现主要负责预训练数据。报道还提到张一鸣给出的两条方向性意见:不蒸馏、别被编程这类短期热点影响。上半年 Seed 内部多个团队反复复盘,眼下正在重新梳理组织和资源分配——与其在现有尺寸上继续追赶,不如把参数一次推到同行的数倍,直接争取领先位置。
[判断] 这是字节典型的”大力出奇迹”打法,但代价摆在明面上:5 万亿参数的训练与推理成本会同时抬高,而当下 HBM 与先进封装产能都在紧张周期里。国内其他几家模型厂要提前想清楚的是要不要跟这一轮参数军备——不跟可能在能力上被拉开身位,跟则要在算力最贵的时候押上一整轮预算。项目还没定,压力已经传出去了。
▪ SIGNAL 跳过追赶直接加码规模,字节赌的是算力能买到时间。
❯ 阿里云视频生成模型 Wan3.0 开启公测,单次可生成 30 秒并支持文档输入
[公测开放] 阿里云新一代视频生成模型 Wan3.0 开启公测,单次可生成 30 秒视频,并在文本、图片、音频、视频四种基础模态之外,首次支持 doc、xls、ppt、pdf、md 等文档格式输入。公测覆盖阿里云百炼、万镜一刻、万相官网和千问创作 PC 端,千问 App 灰度开放。
[价格与口径] API 价格按分辨率分三档:480P、720P、1080P 分别为每秒 0.3 元、0.6 元、1.2 元,接口将于近期全量开放。需要留一句边界:目前这只是公测期参考价,正式定价尚未公布。720P 每秒 6 毛这个价位,对短剧、广告切片这类批量生产内容的团队是有意义的门槛——一条 30 秒成片的模型成本落在 18 元上下。
[用法变化] 支持文档输入这一条比时长更值得看。做企业内容生产的团队可以直接把一份 PPT 或财报表格丢进去出片,中间那道”先把文档改写成分镜提示词”的人工环节被省掉了。视频模型的输入端由此从提示词扩到结构化文件,这会把用户从创意侧往企业办公侧挪一大截,也直接改变了内容团队的人力成本结构。
▪ SIGNAL 能吃 PPT 和表格的视频模型,抢的已经不是剪辑师的活了。
❯ 宇树科技公布战略配售名单,DeepSeek 获配约 1.41 亿元
[名单出炉] 宇树科技科创板首发的战略配售名单公布,共 9 家投资者参与、合计获配 808.93 万股。其中招股文件显示,杭州深度求索(DeepSeek)获配约 93.34 万股,占本次发行数量的 2.31%,金额约 1.41 亿元——这是这家模型公司第一次以战略投资者身份出现在硬件公司的招股名单里。
[同批名单] 与 DeepSeek 同批入围的还有腾讯旗下上海启善投资、中国石油集团昆仑资本、南方电网产融控股集团、天翼资本控股,四家获配比例均为 2.23%,身份都是”与发行人具有战略合作关系或长期合作愿景的大型企业及其下属企业”。发行价定在 150.80 元/股,按发行后总股本计算对应总市值约 609.93 亿元。宇树在文件中给出的引入理由写得很直白:引入大模型龙头,是为了聚焦大模型与具身智能的联合研发,提升机器人对复杂场景的理解与泛化能力。
[信号] 一家以模型为主业、且刚宣布要给 API 涨价的公司,掏出 1.41 亿元买机器人本体厂的战略配售,说明具身智能的分工边界正在松动。做人形机器人的创业公司要重新评估的是大脑侧供应商会不会变成股东乃至对手——当模型厂开始持有本体厂的股权,采购关系和竞争关系就绑在了一起。中石油、南方电网、天翼三家国资同时进场,则把宇树的下游场景从消费展示推向了工业巡检和能源作业。
▪ SIGNAL 模型公司出钱买本体股权,具身智能的上下游正在互相长进对方的地盘。
❯ 美国对光伏产业链设定最低进口价格,组件每瓦不得低于 0.38 美元
[定价落地] 美国对光伏产业链设定最低进口价格:多晶硅每公斤 21 美元,多晶硅锭与硅片每公斤 100 美元,太阳能电池每瓦 0.22 美元,太阳能组件每瓦 0.38 美元,另对列明的多晶硅锭及相关衍生产品加征 15% 从价关税,据报道于 12 月初生效。
[理由与背景] 美方给出的理由不是贸易,而是国家安全:多晶硅同时是半导体的关键材料,牵连雷达、通信以及导弹与无人机的控制系统,因此本土产能被列为要害。此前对光伏的干预主要靠反倾销和 15% 从价关税这类工具,而最低限价比关税更硬——关税只加成本,限价直接划出一条谁都不能低于的地板,把靠规模和成本取胜的路径整条封掉。据报道,这套价格于 12 月初生效,覆盖多晶硅、硅片、电池与组件四个环节。
[外溢] 这条线看起来在光伏,落点却在算力。多晶硅是半导体与太阳能共用的上游,而 AI 数据中心正是当下新增电力需求最凶的买家。先承压的是在美国建数据中心的运营方:组件价格被托在每瓦 0.38 美元以上,配套光伏电站的建设成本跟着抬高,自建绿电的账立刻变难看。电从哪来、多少钱一度,正在变成算力扩张里和买卡同等重要的一栏。
▪ SIGNAL 限价划的是光伏的地板,压到的却是数据中心那本电费账。
OUTLOOK
[今天这批] 今天有五条其实在讲同一件事:便宜的算力时代正在收尾。DeepSeek 挂出涨价通知、英伟达在旗舰卡上削显存、AMD 买下把权重焊进硅片的方案、美国给光伏组件划出价格地板、字节讨论 5 万亿参数——内存和电力这两样硬约束同时收紧,模型规模却还在往上冲。夹在中间的,是所有把成本模型建在 token 会一直变便宜之上的应用团队。