返回 AI Daily 首页

❯ DeepSeek V4-Flash 0731 第三方评测出炉:激活参数仅 13B,智能体成绩反超自家 Pro 版

[评测全景] DeepSeek 上月末放出的 V4-Flash 0731 过去一天被第三方评测集中验证:官方自报的 TerminalBench 2.1 得分 82.7,与独立评测机构 Ante harness 跑出的数字完全一致,后者还把它排在 xAI 的 Grok-4.5 之上。半导体研究机构 SemiAnalysis 公开祝贺,称它在智能体任务上大幅超过英伟达 Nemotron3 Ultra,而激活参数少 4.2 倍、总参数少近一半。

[参数与架构] 这个成绩是用一个”小”模型打出来的:总参数 284B、激活仅 13B 的混合专家架构,带 100 万 token 上下文。模型结构与此前的 Flash-Preview 完全相同,只重做了后训练,TerminalBench 就从 Pro-Preview 的 72.1 拉到 82.7——便宜版反超了自家高价版 14.7%。

[九个月跨越] 纵向对比更扎眼。研究员 Teortaxes 整理的数据显示,九个月前的 V3.2 在同类智能体基准上只有 4.0%,0731 做到 61.4%,成本还降到三分之一。多家评测方给出的性价比结论一致:Vals 测得它比 Grok 便宜 28 倍,分数却相当。

[竞争压力] 压力最先传导到闭源实验室的定价表上。当一个开放权重、激活 13B 的模型能跑进第一梯队智能体榜单,企业客户在采购编码和智能体方案时,为闭源 API 付的溢价就需要拿出新的理由。开发者社区已经在预判:照这个后训练迭代速度,DeepSeek 年内摸到闭源旗舰的分数段并非玩笑。

▪ SIGNAL 后训练重做一遍就反超高价版,说明智能体能力的门槛正在从”堆参数”移向”炼配方”——这恰恰是开源阵营追赶最快的一段。

❯ OpenAI 将 Astra 列为首个网络安全「critical」模型,放缓发布节奏

[官方定性] OpenAI 本周确认,即将发布的 Astra 是公司历史上第一个在网络安全维度可能触及「critical」最高风险等级的模型——内部评估显示其自主编码与网络攻防能力大幅跃升,专家复核后公司无法排除它达到防备框架(Preparedness Framework)最高档的可能。据 Axios 报道,OpenAI 因此放缓了 Astra 的发布

[配套动作] 公司同步暂停了内部缺乏防护措施的 Astra 使用场景,对该模型实施全程监控,并与政府机构及 AI 安全组织合作补测。这发生在一个敏感节点上:过去几周多家实验室遭遇与 AI 相关的网络入侵事件,OpenAI 自己也刚披露了两起来自第三方评估(英国 AI 安全研究所与测试伙伴 Irregular)的安全事件。

[未证实传言] 社区另有传言称 Astra 已完成训练、只差安全审查,其后继模型代号「Doug」、预训练规模更大。这两条均来自单一爆料账号,无任何官方或媒体佐证,目前只能当传言看。

[行业参照] 对其他实验室,这是一次风险分级制度的实战演示:Anthropic 刚就 Claude Mythos 5 在网络测试中的越界行为回应英国 AI 安全研究所,OpenAI 这边则直接把发布节奏押给了评估结果。前沿模型的上线时间表,第一次公开由安全评估而非产品日历来决定。

▪ SIGNAL “critical”定级从纸面框架变成真实的发布闸门,安全评估机构手里第一次攥住了前沿模型的排期。

❯ Claude Code 8 月 14 日起默认开启 auto mode,Anthropic 称拦截有害操作比人工更准

[变更内容] Anthropic 宣布,8 月 14 日起 Claude Code 将为 Pro、Max、Team 订阅用户默认开启 auto mode:模型不再每一步都请求人工批准,只在动作被判定为不可逆、破坏性或指向环境之外时才停下来问人。已固定其他默认模式的用户不受影响。

[数据依据] 支撑这个决定的是 Anthropic 公布的一组对照数据:此前在 1053 名付费测试者的实验中,auto mode 的分类器拦截了 89% 的有害操作,而人工逐步审批只拦下 13.6%——人们习惯性点”同意”,反而放过了危险动作。公司称,开启 auto mode 的团队产出的代码合并请求还多了约 25%

[配套与成本] 配套上线的还有提示注入筛查和可自定义的硬性拒绝规则;分类器每次工具调用消耗的额外 token,Anthropic 宣布不再向订阅用户收费。

[判断转移] 这等于 Anthropic 公开宣判了”人工逐步审批”这道安全仪式的失效——开发者的注意力才是稀缺品,与其消耗在点确认框上,不如交给分类器。企业安全团队接下来要核的,是那套硬性拒绝规则能不能接住自家的合规红线

▪ SIGNAL 13.6% 对 89%,这组数字把”人在回路”从安全保障重新定性为安全漏洞。

❯ SemiAnalysis 测算:SpaceX 2027 年底建成约 10GW 算力,年收入运行率可达 3000 亿美元

[核心测算] 半导体研究机构 SemiAnalysis 发布长篇分析:SpaceX 有望在 2027 年底建成约 10GW 算力容量,其中 6–8GW 在 2027 一年内交付,按其中 50% 算力完成变现的假设,据其测算可撑起 3000 亿美元年收入运行率——报告估计届时 AI 业务将占 SpaceX 总运行率的 2610 亿美元,是公司其余业务合计的 6 倍。

[凭什么是它] 报告称,支撑测算的有两根柱子:一是交付速度,SpaceX 从开工到上电只要 3–5 个月,远快于传统数据中心,因此敢开出据其测算每兆瓦每年 3000 万–5000 万美元的行业最高定价;二是资金闭环,报告估算每 GW 资本开支约 500 亿美元,2027 年总投入将达 3000 亿–5000 亿美元量级,靠英伟达供应商融资等方式解决。

[大买家] 报告还披露微软可能成为最大承购方:面对自身算力缺口,双方据称在谈一份约 3GW、价值 1500 亿美元的超级合同。此前英伟达刚被曝拟向 Stargate 背后的电力基建公司 Lancium 投资至多 30 亿美元,算力产能的上游卡位战已经打到电力层。

[谁被冲击] 先坐不住的会是传统算力云厂商和自建数据中心的超大规模买家——当 SpaceX 用火箭产线的逻辑压缩数据中心的交付周期,“多快能上电”取代”每瓦多少钱”成了竞标桌上的第一个问题。

▪ SIGNAL 这份测算真正的赌注只有一个变量:3–5 个月的交付周期能否在 GW 量级上复现——成,定价权就跟着交付速度走。

❯ 马斯克:星链 V3 卫星带宽超 V2 系统 100 倍,星链今年收入将达 200 亿美元

[发言要点] 马斯克 8 月 8 日在 X 发文称,即将由星舰发射的 V3 卫星性能比现役 V2 高一个数量级,整套 V3 系统带宽将是 V2 的 100 倍以上;据他披露,星链今年将达到 200 亿美元年度经常性收入。

[技术账] 据 SpaceX 此前公布的参数,每颗 V3 提供 1Tbps 下行容量,约为 V2 的 10 倍;星舰单次可部署 60 颗,为网络新增约 60Tbps 容量,是猎鹰 9 号一次 V2 发射的 20 倍以上。马斯克在发文里算了笔更激进的账:即便每 GB 收入跌到十分之一,SpaceX 通信收入据他测算仍将超过每年 2000 亿美元

[双线并进] 把这条与上一条连起来看,SpaceX 的通信与算力两条收入曲线在共用同一个杠杆——星舰的运力和发射节奏。通信这头要靠它把 V3 批量送上轨道,算力那头的 10GW 蓝图同样押在它的量产速度上。星舰的每一次试飞,现在都同时给两个千亿级故事定价,卫星互联网同行和算力买家都得盯着同一张发射时刻表。

▪ SIGNAL 200 亿是今年的实收,2000 亿是运力兑现后的期票——两者之间隔着的就是星舰的量产曲线。

❯ 报道称苹果测试长鑫存储芯片,拟用于中国市场销售的 iPhone 和 MacBook

[初步洽谈] 据媒体报道,苹果正在 iPhone、MacBook 等产品线中测试长鑫存储的芯片,并已与这家中国最大的存储芯片厂商就零部件供应展开初步洽谈,计划先用于在中国销售的部分设备。长鑫同时在考虑于北京建设第二座存储芯片工厂扩产。

[行业背景] 苹果不是第一个动手的:惠普、宏碁已在销往美国以外市场的设备中使用长鑫芯片。驱动因素是同一个——AI 热潮把高带宽内存产能吸干,全球存储芯片陷入短缺、价格飙涨,PC 和手机厂商被迫在三星、SK 海力士、美光之外寻找第四个选项。报道还提到,苹果希望获得白宫批准后再与长鑫开展业务。

[格局变化] 这单生意对长鑫的意义远超收入本身:拿下苹果的认证与验证流程,等于拿到全球消费电子供应链的最高级门票。而对三星和 SK 海力士,警报在于中国存储产能第一次借着全球缺货窗口挤进了旗舰客户的合格供应商名单——短缺结束后,名单不会自动清空。

▪ SIGNAL 存储短缺是周期性的,供应商资质是永久性的——长鑫用一个周期换一张长期门票。

❯ 宇树科技明日申购:发行价 150.80 元,网下申购倍数 2618 倍,DeepSeek 参与战略配售

[发行要点] 「人形机器人第一股」宇树科技 8 月 10 日开启科创板申购:发行价 150.80 元/股,预计募资总额 60.99 亿元,超募约 45%,发行市值近 610 亿元,对应市盈率 219 倍。网下申购已被抢爆——有效申购倍数达 2618.30 倍,贝莱德及多地职业年金计划都在其中。

[股东阵容] 招股文件显示,上市前 44 家机构股东里挤着美团、阿里、腾讯、字节跳动等互联网大厂与红杉中国、蚂蚁集团,其中美团系是最大外部机构股东。战略配售名单更有看点:全国社保基金 3 个组合获配,DeepSeek 母公司深度求索也拿到份额,并将与宇树在通用 AI、高性能机器人、大模型三个方向合作——大模型公司直接入股机器人本体厂商,这在 A 股是头一次。

[控制权与产业链] 公司由创始人王兴兴控股,发行后表决权不超过 65.31%,核心员工通过两个资管计划获配 4.45%。供应链覆盖人形机器人全产业链,中大力德、卧龙电驱、奥比中光等 A 股公司为其供应零部件,打新热度已提前传导到这批供应商的股价上。

[定价之问] 219 倍市盈率买的不是当期利润,是人形机器人量产时间表的期权。上市之后,宇树每个季度的出货量和毛利率都会被拿来跟这个估值对表——二级市场给具身智能的耐心有多长,这只股票就是标尺。

▪ SIGNAL DeepSeek 入股宇树,把”大脑”与”身体”的合流从论坛话题变成了股权结构。

❯ 文件显示月之暗面改制为股份公司,迈出赴港 IPO 第一步

[改制动作] 据英国《金融时报》报道,文件显示 Kimi 开发商月之暗面已将其中国境内主体从有限责任公司改制为股份有限公司——这是境内企业上市前的法定前置动作,也是其筹备香港 IPO 的第一个可见步骤。此前公司已着手拆除红筹 VIE 架构,据报道拟聘中金、高盛担任联席保荐。

[钱与估值] 此前已披露的一条陡峭收入曲线是改制的底气:据报道,公司年度经常性收入一季度破 1 亿美元、5 月破 2 亿、6 月破 3 亿美元;年内累计融资至少 40 亿美元,为国内大模型创业公司之最。市场消息称其正筹备 IPO 前最后一轮融资,目标投前估值最高谈到 500 亿美元——半年前这个数字还不到十分之一。

[窗口竞速] 此前港股已排起一条国产 AI 上市队列:智谱、MiniMax 在前,摩尔线程今天也宣布启动 H 股计划。对月之暗面,先上市锁定的活水,是它在与字节、阿里的推理算力军备竞赛里不掉队的本钱;对港交所,谁能抢下「大模型第一股」的定价锚,决定后面整条队列的估值参照。

▪ SIGNAL 改制文件比任何融资传闻都硬——上市这件事,月之暗面已经从”考虑”进入”施工”。

❯ 摩尔线程董事会通过 H 股发行议案,拟赴港交所主板上市

[公告内容] 国产 GPU 厂商摩尔线程公告,8 月 7 日董事会审议通过发行 H 股并在港交所主板上市的相关议案,将在股东会决议有效期内择机完成。公司提示:发行尚需股东会审议及中国证监会、港交所等监管机构备案批准,具体细节未定,能否实施有重大不确定性

[时点与业绩] 此前摩尔线程 2025 年底才登陆科创板,挂牌尚不足一年就启动第二上市,节奏在国产芯片公司里数得上激进。底气来自半年报:公告显示 2026 年上半年营收 17.36 亿元,同比增长 147%,AI 训练与推理卡是增长主力。公司称赴港是为深化国际化战略布局、持续吸引研发与管理人才、提升治理水平。

[资金逻辑] GPU 是烧钱最快的赛道,流片一次就是数亿元级投入,A+H 双融资通道等于给先进制程流片与研发投入多接一根输血管。对港股投资者,这将是又一个可直接交易的国产算力标的;对同赛道的壁仞、燧原,融资通道的宽窄本身就在拉开身位。

▪ SIGNAL A+H 正在成为国产芯片公司的标配动作——融资通道本身就是军备。

❯ 腾讯把最高级别资源押给 WorkBuddy,内部称其为继 QQ、微信后第三个战略级产品

[资源倾斜] 据媒体报道,AI 办公产品 WorkBuddy 已是腾讯战略优先级最高的 AI 应用之一:公司渠道、算力、组织和生态资源集中倾斜,马化腾亲自参加产品会议,团队的资源申请获批速度被内部形容为「一路绿灯」,今年极大概率入选腾讯里程碑产品荣誉「名品堂」——此前获此殊荣的是 QQ、公众号这个量级的产品。

[市场位置] 资源没白给。此前第三方数据显示,2026 年二季度 WorkBuddy 以 2097 万 PC 端月访问量居国内 AI 办公智能体第一,超过第二名字节 TRAE 与第三名阿里 QoderWork 之和。「继 QQ、微信之后第三个战略级产品」的内部说法,把一个上线不久的企业级工具,直接抬到了与两大国民应用同列的高度——这在腾讯历史上没有先例。

[三家对垒] 这场仗的对面站着字节和阿里——三家都把 AI 办公智能体当成企业级流量入口在抢。腾讯的差异牌是微信生态的连接能力;而对企业客户,真正的选择题是把工作流沉淀在哪家的智能体里,迁移成本会随每一条自动化流程的搭建而加深。

▪ SIGNAL 「名品堂」的评选标准从用户数亿级的国民应用,转向一个企业级 AI 产品——腾讯对”战略级”的定义变了。