❯ OpenAI 自研推理芯片 Jalapeño 公布首批实测,每瓦性能超英伟达 GB300
[首批实测] OpenAI 在 8 月 25 日的 Hot Chips 大会上放出自研推理芯片 Jalapeño 的首批性能数据:在 GPT-OSS 120B、DeepSeek R1、Kimi K2.5 1T 三个模型上,每瓦有效算力达到英伟达 GB200 与 GB300 系统的 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍。芯片由 OpenAI 与博通联合设计,测试跑在 SemiAnalysis 的 InferenceX 平台上。
[硬件底牌] 单封装配 6 组 HBM4,容量 216 GiB、带宽 15.4 TB/s,标称功耗 700 瓦,而实测负载下始终压在 550 瓦以内——对手 GB300 的整卡功耗是 1400 瓦。切到高交互式负载,差距进一步拉开到 2.1 至 4.1 倍。首代芯片就在这条曲线上压过英伟达当代旗舰,是过去三年没出现过的事。
[产能是关键] OpenAI 自己给的部署节奏很克制:2026 年底才小批量上线,规模化要等 2027 年。所以短期内英伟达的出货量不会掉一片,真正的变化在采购谈判桌上——当模型公司手里有一颗自己能造、且每瓦更划算的推理芯片,议价的底牌就换了一张。在电力受限的数据中心里,每瓦 token 数直接换算成营收,这是 OpenAI 唯一在意的指标。
▪ SIGNAL首代 ASIC 打赢当代旗舰 GPU,赢的不是制程,是把模型、编译器和硅片放进同一个迭代周期的能力。
❯ 英伟达通知客户明年初系统涨价约 17%,Vera Rubin 整机柜升至 780 万美元
[涨价通知] 据 The Information 报道,服务器厂商已通知客户,英伟达旗舰 AI 系统价格将上调约 17%,明年初出货的 Vera Rubin 与 Grace Blackwell 机型全部覆盖。摩根士丹利测算,Vera Rubin VR200 NVL72 整机柜约 780 万美元,是当代 GB300 NVL72 约 400 万美元的近两倍。
[成本拆解] 涨价的主因不在 GPU——报道称 Rubin 芯片单颗仅约 5 万美元。真正膨胀的是内存:目前单机柜内存成本约 200 万美元,较上一代涨 435%,占整柜成本约四分之一,LPDDR5X 容量翻到 54 TB。此前一直被忽略的被动元件也在涨:印制电路板成本涨 233%,片式电容涨 182%,载板涨 82%。整条供应链的价值正从计算芯片往存储和元件那头挪。
[谁来买单] 按这个口径,一座 1 吉瓦数据中心的建设成本要多出 至少 50 亿美元。云厂商大概率把涨幅转嫁给租算力的客户,而同一周 OpenAI 刚亮出自研芯片的能效账。研究员 teortaxesTex 的说法是,推理这一侧英伟达已经没有纯技术护城河,剩下的是资产负债表和供应链长约。要重算的是 AI 应用公司的单位推理成本曲线:过去两年它一路向下,明年可能第一次掉头。
▪ SIGNAL内存吃掉四分之一机柜成本的那一刻,AI 算力的定价权就已经在从英伟达手里往存储厂那边流。
❯ 英伟达 Groq 3 LPX 机架进入全面量产,Nebius 成首家采用的 AI 云厂商
[量产上线] 英伟达 8 月 24 日宣布推理加速器 Groq 3 LPX 机架全面量产,将与 Vera 中央处理器、Rubin 图形处理器一同部署,年内在新型云厂商 Nebius 的数据中心上线。这是英伟达 200 亿美元拿下 Groq 之后,第一批真正落地的机架产品。
[性能口径] 按官方公告,单机架塞进 256 颗 LPU,配 128 GB 片上 SRAM、640 TB/s 纵向扩展带宽,采用 MGX 架构全液冷。在 Artificial Analysis 用开源智能体模型 Gemma 4 31B 做的测试中,10 万 token 长上下文场景输出 3400 token/秒,是最接近的替代平台的 4 倍。此前单卡通吃的做法目前也被拆开:Rubin 图形处理器扛上下文预处理,LPU 专收延迟敏感的解码阶段,两者在同一套机柜里分工。
[智能体账本] 同批公布的还有 Vera Rubin NVL72 在真实智能体负载下的成绩。英伟达称,基于 SemiAnalysis 的 AgentX 负载、跑 DeepSeek V4 Pro 模型,每兆瓦吞吐量最高是上代 GB300 NVL72 的 30 倍,每 token 成本最高降 35 倍。这套数字直接冲着 Jalapeño 那张能效表来的——固定电力预算下能撑多少并发智能体,正在取代峰值算力成为机房招标的第一指标。
▪ SIGNAL把预填充和解码拆到两种芯片上,英伟达承认了单一 GPU 通吃推理全流程的时代结束了。
❯ Arm 在 Hot Chips 披露首颗自研量产 CPU,136 核专攻智能体调度
[三十六年首次] Arm 在 Hot Chips 2026 上拆解了 AGI CPU 的完整细节——这是公司成立以来第一次不卖 IP、直接卖成品硅片。单颗最多 136 个 Neoverse V3 核心,Armv9.2 架构,最高频率 3.7 GHz,台积电 3 纳米工艺双芯粒设计,整颗超过 1000 亿个晶体管,热设计功耗 300 瓦。
[规格与伙伴] 按 Arm 在会上披露的口径,每核心独享 2 MB 二级缓存,乱序执行窗口超过 384 条目,支持 10 路分发、8 路提交。内存与 I/O 直接集成,延迟低于 100 纳秒,12 通道 DDR5-8800 提供 845 GB/s 带宽,单颗支持 6 TB 内存容量,另有 96 条 PCIe Gen6 通道并支持 CXL 3.0。这颗芯片此前已与 Meta 联合开发,目前 OpenAI、Cerebras、Cloudflare 都在首批伙伴名单里。
[为什么是现在] Arm 把它定位成智能体基础设施的 CPU 侧编排器:协调加速器、管理数据搬运。这块活以前默认由 x86 承担,而智能体工作流把它的分量顶了上来——一次任务要反复调工具、切上下文、协调多个模型,CPU 侧的调度延迟会沿着推理链条累积。英特尔和 AMD 的数据中心订单第一次要面对一个既定标准又亲自造芯的竞争对手,云厂商的下一轮 CPU 采购清单会先出现变化。
▪ SIGNAL从收授权费改成卖芯片,Arm 拿走了自己客户的生意,这个转身比 136 核这个数字更值钱。
❯ 法律 AI 公司 Harvey 基于月之暗面 Kimi K3 后训练出自研模型 Tenet
[路线掉头] 法律 AI 公司 Harvey 宣布首个自研模型 Harvey Tenet,底座用的是月之暗面的开放权重模型 Kimi K3,训练伙伴是推理平台 Fireworks AI。此前 Harvey 一直在 OpenAI、Anthropic、谷歌的闭源模型上做定制,这次是第一次把基座换成中国实验室的开放权重模型。
[训练方法] Tenet 走的是异步强化学习,数据混合了合成数据、公开法律语料和人类专家标注,目标是长周期的智能体式法律任务——一份尽调要拆成几十步、跨几百份文件。Harvey 自己公布的评测里,Tenet 在多项法律智能体与知识基准上与 Anthropic、OpenAI、谷歌的前沿模型可比。第三方复现尚未出现,这套成绩仍以公司口径为准。
[采购逻辑变了] Harvey 今年 3 月完成 2 亿美元融资,估值 110 亿美元,由新加坡政府投资公司与红杉联合领投,累计融资超 10 亿美元;1 月披露的年化经常性收入为 1.9 亿美元,超过 1300 家机构、10 万名律师在用。一家跑到这个体量的美国垂直 AI 公司,把最核心的模型层押给中国开放权重底座,中国实验室第一次进了美国头部应用公司的训练体系。
▪ SIGNAL开放权重的胜负手不在跑分榜,在有没有人愿意把自己的核心产品架在上面。
❯ 华尔街日报:Anthropic 拟向 IPO 投资人给出超 30 万亿美元收入空间
[口径披露] 据华尔街日报报道,Anthropic 大概率会向 IPO 投资人给出超过 30 万亿美元的潜在收入空间,压过 SpaceX 此前的 28.5 万亿美元。这个数字的算法是把 AI 可承接的全部人类工作折成年收入,而不是从软件市场规模往上推。
[历史坐标] 同类叙事有过参照:优步 2019 年上市时给出的是 6 万亿美元。纽约大学金融学教授达摩达兰在 SpaceX 上市前就评价过这类算法,说这类算法已经走到可信区间的尽头还在往外推。Anthropic 今年 2 月刚以 3800 亿美元估值完成 300 亿美元融资,据报道 2028 年收入预期在 1900 亿至 2000 亿美元区间,IPO 目标估值约 2 万亿美元。
[共存的算术难题] OpenAI、Anthropic、SpaceX 都在讲同一件事:AI 接管人类工作,赢家通吃。可这三个 30 万亿量级的数字彼此重叠,谁都拿不到全部——如果真是通吃格局,那三家里至少有两家的份额趋近于零。基石投资人要问的不是这个市场有多大,而是 Anthropic 凭什么在其中拿到可辨认的一块——这个问题的答案会直接决定 IPO 定价区间和后续的资本开支节奏。
▪ SIGNALTAM 越大,越说明公司还没有一条能被审计的收入路径可讲。
❯ 库克 9 月 1 日卸任苹果 CEO,泰尔纳斯接任并进入董事会
[交接确认] 蒂姆·库克将于 9 月 1 日 正式卸任苹果 CEO,硬件工程高级副总裁约翰·泰尔纳斯接任并进入董事会。这一安排 4 月已公布,本周进入执行阶段。库克留任执行董事长,主要负责与各国政策制定者打交道。
[告别场面] 8 月 23 日,也就是库克出任 CEO 十五周年的前一天,苹果在园区 Caffé Macs 餐厅办了一场约 200 人的送别会,OneRepublic 乐队现场演出,劳伦·鲍威尔·乔布斯与泰尔纳斯先后致辞。The Information 另称,库克的助理目前已转而配合泰尔纳斯工作——这类细节通常说明交接已经落到日常层面,而不只是头衔变更。
[留给继任者的题] 库克十五年把苹果从 3500 亿美元做到全球市值前列,靠的是供应链与硬件毛利。泰尔纳斯接手的却是一家在生成式 AI 上被普遍认为落后一代的公司:Siri 重构一再延期,自研大模型迟迟未见,Apple Intelligence 的核心能力仍在外部合作与自研之间摇摆。第一个要拍的板是自研还是继续外采,而这件事不像换一颗芯片那样能靠供应链管理解决。
▪ SIGNAL硬件工程师出身的 CEO 接一家软件叙事落后的公司,苹果这次赌的是自研芯片能把 AI 差距追回来。
❯ 苹果发布首颗 2 纳米芯片 M6,AI 性能较 M4 提升至 4 倍
[首颗2纳米] 苹果在新闻稿中发布 M6,公司首颗 2 纳米工艺芯片,用在新款 Mac mini 上。12 核 CPU 比 M4 与 M5 各多两核,12 核 GPU 同样加两核,最高 32 GB 统一内存,苹果称其提供”全球最快的单线程性能”。同场还发布了搭载 M5 Ultra 的新款 Mac Studio。
[核心配置] M6 是苹果第一颗同时用上三种 CPU 核心类型的芯片:2 颗超核、4 颗性能核、6 颗能效核,多线程性能较 M4 快至 40%。神经加速器此前只在高端型号上出现,这次首次下放到入门款 Mac mini,公司称 AI 性能达到 M4 的 4 倍,图形性能 2 倍。Mac Studio 那颗 M5 Ultra 是苹果目前首个四芯粒架构,最高 36 核 CPU,其中 12 颗超核、24 颗性能核。
[本地推理这条线] 2 纳米加上神经加速器下放,直接受益的是在本地跑模型的开发者:一台入门 Mac mini 就能承担过去要连云端的推理量。同一天 Perplexity 发布的本地版智能体给出了同一个方向的信号。桌面端的算力门槛在往下掉,够不够跑得动主流开源模型,是今后一年衡量个人开发环境的那把尺子。
▪ SIGNAL苹果没讲 AI 故事,它把神经加速器塞进了最便宜那台机器里。
❯ 宇树科技上市三日回撤 45%,市值从 660 亿美元缩至 360 亿
[剧烈回撤] 据路透报道,中国人形机器人公司宇树科技上海上市后急跌,股价自峰值回撤约 45%,市值由约 660 亿美元缩至 360 亿美元,三天蒸发约 300 亿。8 月 19 日首日收盘价 845 元,较 150.80 元的发行价涨 460%。
[基本面对照] 支撑这轮暴涨暴跌的基本面目前并不牢固:财报显示,公司调整后一季度利润因成本上升同比下滑约 53%,降至约 4000 万元人民币,与 2025 年全年的表现形成明显落差。这轮行情也把中国 IPO 定价机制推到台前——一边限制新股供给,一边在上市后对日内涨跌幅设限,两条规则叠加,天然容易制造首日的极端涨幅和随后的踩踏。
[散户在承接] 460% 首日涨幅并非孤例,去年内地新股首日平均涨幅就有 225%。真正的问题在于承接盘:追在峰值的散户正在消化这 300 亿美元的落差。具身智能这个赛道今年在一级市场融资顺畅,宇树是第一家把估值拿到二级市场公开定价的头部公司,它的回撤会直接压到后面几家的发行窗口和估值区间。
▪ SIGNAL人形机器人第一次由公开市场定价,结果是三天砍掉一半——一级市场的估值锚要重新找了。
❯ Stability AI 完成 7600 万美元 B 轮,三大唱片公司与艺电同时进场
[罕见组合] 据公司公告,图像生成模型 Stable Diffusion 的开发商 Stability AI 完成 7600 万美元 B 轮融资,环球音乐、索尼音乐、华纳音乐三大唱片集团与游戏公司艺电同时进场,AMD Ventures、Pacific Alliance Ventures 跟投,Coatue、格雷克罗夫特、肖恩·帕克与埃里克·施密特等老股东继续加注。
[从诉讼到入股] 这三家唱片公司过去两年是生成式 AI 音乐版权诉讼的主力原告,如今换到了股东席上。转折点是先有合作再有投资:华纳 2025 年 11 月宣布与 Stability 共建艺人友好的 AI 工具,环球与艺电也各自签了用自有目录与知识产权训练模型的协议。Stability 随后推出基于授权数据训练的 Stable Audio 3.0,配套提供数字音频工作站插件。
[授权数据的价格] 这一轮把 Stability 在现任 CEO 任内的累计融资推到 2.32 亿美元。金额在今天的 AI 融资里算不上大,但结构少见——内容方用股权换取对训练数据条款的话语权,而不是继续在法庭上争。其他还在打官司的模型公司会拿这笔交易当参照:合作入股比判决来得快,也比判决可控。
▪ SIGNAL唱片公司从原告变成股东,说明版权方已经算清楚了——分账比禁令更划算。
❯ Perplexity 推出全本地版 Portable Computer,本地步骤零 token 成本
[全本地运行] Perplexity 联合英伟达推出 Portable Computer,把模型、推理引擎、智能体框架、工具沙盒与应用连接器打包成一套系统,全部跑在用户自己的硬件上,本地步骤不计 token 费用。首发支持 Qwen 3.8 27B 与 Perplexity 自研后训练的 PPLX 27B,英伟达 Nemotron 3.5 Lightning 30B 随后跟上。
[硬件门槛] 运行环境是英伟达 DGX OS 或 Ubuntu,ARM 与 x64 架构都可以,RTX 显卡需要至少 24 GB 显存;桌面级的英伟达 DGX Spark 是目前主推形态。遇到本地模型吃不下的任务,它会停下来征询是否转交云端大模型,而不是默默上传,沙盒则由操作系统层面强制隔离。此前同类本地方案多半只提供模型权重,工具链仍要自己拼。
[装机这件事被省了] 这套东西最实在的价值是把”自己搭一套本地智能体”的门槛砍掉——起推理服务、接工具、配沙盒,过去要花几天。企业里管数据出境的合规负责人因此多了一个选项:敏感文档的处理可以完全不出机器。订阅制 AI 应用一直靠云端调用计费,本地这条路一旦跑通,计费口径本身要重写。
▪ SIGNAL零 token 成本不是省钱,是把数据不出门这件事从合规承诺变成物理事实。
❯ Anthropic 打通 Claude 对话与 Cowork 记忆,默认开启且需手动退出
[记忆打通] Anthropic 在 8 月 25 日把 Claude 对话与 Claude Cowork 的记忆系统合并:在一边学到的东西,在另一边直接可用。记忆写入同时改成实时更新,不再等对话结束后才落库。免费、Pro、Max 三档均默认开启。
[敏感项默认关闭] 官方说明称,健康数据、种族、宗教信仰、政治立场、性别认同等敏感类别默认不写入记忆,用户可在设置里手动打开”记忆包含敏感话题”这一开关。此前两个产品的记忆各自独立,目前想让它们彻底分开只剩三条路:换用不同账号、整体暂停记忆功能,或者全程使用无痕对话。退出成本被抬高了一档。
[默认值之争] 打通带来的便利很直接,代价是工作场景与私人对话的边界消失了。用 Cowork 处理公司文档、又用对话聊私事的用户,现在共享同一份记忆。默认开启加手动退出这套组合,把选择的成本压在了用户这一侧,企业客户的合规审查要多加一栏。
▪ SIGNAL记忆一旦跨产品打通,用户对”这家公司知道我多少”的估算就得整个重来。
❯ 传言称 OpenAI 已训完万亿级基座模型 Bel,官方未作任何确认
[传言内容] 社交媒体流传的说法是,OpenAI 已完成代号 Bel 的预训练,总参数超过 10 万亿,是此前代号 Doug 的后继者,可能成为 GPT-6 一代的基座。传播链条清晰:源头是账号 @synthwavedd,经 kimmonismus 等聚合账号扩散,OpenAI 没有任何官方表态。
[可信度判断] 这条消息目前是单一来源的孤证,没有一线记者跟进,也没有第二个独立信源交叉验证。同一批传播里还夹着”Anthropic 算力不足以应对 OpenAI 年内的 Astra 发布”这类说法,同样无从核实。Bel、Doug、Astra 这套代号体系此前从未获得官方确认,10 万亿参数这个量级也没有任何供应链或算力采购层面的佐证。
[为什么它能传开] 传言之所以有市场,是因为万亿参数预训练是否还在推进本身就是个未决问题——过去一年公开讨论的重心已经转向后训练与推理时计算。真要判断这条消息,能作数的只有算力采购、招聘、供应链这类可观测的侧面证据。在那之前,把它当参数规模路线仍未被放弃的一个信号即可,不宜作为事实引用。
▪ SIGNAL一条无人证实的参数传言能刷屏一天,本身说明市场仍在等一次预训练层面的跃迁。
❯ OpenAI 恢复 ChatGPT Plus 的 Codex 五小时限额,Pro 档暂不受影响
[限额回归] OpenAI 从 8 月 25 日起恢复 ChatGPT Plus 用户在 Codex 与 ChatGPT Work 上的五小时用量限额。此前几周该限额被临时取消,只保留周度上限。100 美元与 200 美元的 Pro 档未来几个月不受影响。
[官方理由] Codex 与 ChatGPT 的工程负责人公开给的解释有两层:一是平滑算力负载,让周度额度能继续维持在宽松水平;二是 Plus 档用户里新手较多,此前在没有小时窗口约束时,容易在两三天内不知不觉耗光整周额度,随后陷入困惑。目前周度上限本身没有调整,变化的只是这层 5 小时的滚动窗口——用户拿到的仍是同一份 7 天额度,只是不能在 2 天内提前用完。
[额度即定价] 大模型订阅的真实价格不写在标价上,写在限额里。同一个 Plus 档位在几周内经历取消限额又恢复,说明 OpenAI 还在用额度参数实时调节算力供需。按小时窗口买算力的开发者得把这条当成常态:定价页不变,可用量随时会变。
▪ SIGNAL订阅费固定而限额浮动,AI 服务实际上已经在按算力现货定价了。
❯ Zoom 二季度营收同比增 4.9% 至 12.8 亿美元,三季度利润指引低于预期
[财报数字] Zoom 2027 财年二季度营收 12.8 亿美元,同比增 4.9%,略高于 12.7 亿美元的市场预期;企业业务营收增 7.8% 至 7.875 亿美元,是近三年最快的增速。调整后每股收益 1.55 美元,高于 1.48 美元的预期。
[指引分歧] 公司上调了全年口径:营收指引 50.85 亿至 50.95 亿美元,调整后每股收益 6.08 至 6.12 美元,均高于此前。但三季度调整后每股收益指引低于分析师预期,营收指引 12.75 亿至 12.80 亿美元,环比几乎持平——上调全年、压低当季这个组合,通常对应的是把 AI 相关支出集中记在下半年。
[增速的天花板] 5% 左右的整体增速与 7.8% 的企业增速之间那道口子,是消费与中小客户业务在拖。Zoom 过去两年一直在讲 AI Companion 的故事,而营收结构还没有出现被 AI 改写的迹象。再往后要盯的是企业增速能否连续两个季度稳在 7% 以上——达不到,这条 AI 转型叙事就只能算工具功能升级。
▪ SIGNAL企业增速三年新高却带不动整体,Zoom 的 AI 故事目前只在最贵的那部分客户里成立。
❯ OnlyFans 财年向创作者分成 63 亿美元,净营收同比增约 10%
[英国备案] 母公司 Fenix International 向英国公司注册处提交的账目显示,截至 2025 年 11 月 30 日的财年,OnlyFans 向创作者分成 63 亿美元,净营收同比增约 10% 至约 15.5 亿美元,税前利润增 5% 至 7.15 亿美元。十年累计分成已超过 300 亿美元。
[创作者结构] 备案文件显示,平台创作者账号数已达到 500 万,2016 年以来累计有 5076 人收入过百万美元,占全部创作者的比例约万分之十。这套模型的分成率长期稳定在八成,平台留两成,在创作者经济里少见地没有随规模扩张下调过抽成——目前多数内容平台的抽成都在随体量抬升。
[对照组的价值] 在 AI 内容平台普遍讲不清创作者怎么赚钱的当下,这份财报的参照意义在于它是唯一公开完整分成账本的大型 UGC 平台。63 亿美元实付分成对 15.5 亿美元净营收,比例摆在明面上。任何声称要用 AI 重做创作者经济的产品,在谈自己的分账方案时都绕不开这个已经被验证过的基准,创作者迁移的成本就摆在这条比例线上。
▪ SIGNAL八二分成十年没变,这个数字比任何创作者友好宣言都更能说明平台的议价位置。