返回 AI Daily 首页
2026-09-09-星期三 · #OpenAI · #Cognition · #Devin · #Meta · #Muse · #Images2.5 · #AlphaGenome · #DeepSeek · #Anthropic · #Fable · #Antioch · #Arm · #Oura · #AI算力 · #机器人仿真

❯ OpenAI 称万名智能体用 88 小时求得纳维-斯托克斯难题解法,所用模型尚未公开

[万级协作] OpenAI 于9月8日公布一项数学突破声明:内部模型驱动约 1万个并发智能体,用 88 小时求得纳维-斯托克斯存在性与光滑性问题的解法。公司同时提供论文与 Lean 形式化证明,称所用模型的能力显著超过刚发布的 GPT-6 Astra。

[证明对象] 按公司当前说明,结果涉及受到光滑外力作用的三维流体:初始状态光滑,运动中总能量保持有限,却能在有限时间形成奇点。OpenAI 称其满足千禧年难题正式表述中的相关反例条件。有外力的情形必须写清,不能将结果泛化为所有流体问题均已解决。

[计算过程] 智能体被分组探索不同路径,再由 Codex 汇总有用发现、交换进展。公司披露,这项工作消耗约 1300 亿输出令牌,完成解法后,GPT-6 Astra 又用 17 小时进行形式化与验证。研究系统在搜索期间还更新过模型,不能把结果简单归结为增加智能体数量。

[审查与归属] 这仍是一项需要数学界检查的公司研究声明,形式化验证也不能替代对定理表述与原问题是否吻合的审查。相关工作的署名和数据使用存在争议,OpenAI 否认访问特定用户数据来求解。科研团队采用模型时,成果审查与数据约定都须跟上计算能力。

▪ SIGNAL万级协作的科研价值要同时接受证明审查、计算成本和成果归属的检验,单凭智能体数量还不能推出通用突破。

❯ AI 编程公司 Cognition 融资超 20 亿美元,估值升至 480 亿美元,年化收入接近 9 亿美元

[融资落地] AI 编程公司 Cognition 公告称完成 超 20 亿美元E轮融资,估值达到 480 亿美元,由新投资者 Andreessen Horowitz 与 Accel 领投。公司5月上一轮估值为 260 亿美元,约四个月上升 85%,资金继续支持 Devin 的企业部署。

[收入对照] 公司披露,同期年化收入由 4.92 亿美元增至接近 9亿美元,增幅约 83%。估值与收入增速大致同步,按这两个时点粗算,估值相当于年化收入约 53 倍。不过,年化收入是当期业务速度的外推,并非过去一年已经确认的营业收入。

[从写码到执行] Devin 的产品范围正向工程流程扩展:自动处理故障排查的初步工作、发现和分类安全漏洞,也能由团队日常系统中的事件触发任务。公司称客户正在扩大采用。商业化考验随之变为任务能否交付,以及接入企业代码和流程后需要多少人工复核。

[采购尺度] 接近翻倍的收入为新估值提供了增长依据,但高倍数仍要求后续扩张兑现。企业工程团队衡量订阅价值时,需要把节省的开发工时与审查、返工成本放在一起核算。能够稳定完成任务、进入经常性预算的用量,才比一次演示更能支撑续约。

▪ SIGNAL估值与年化收入同步增长,商业化压力落在后续续约和真实交付上,新增调用量本身还不足以证明工程成本下降。

❯ Meta 发布个人智能体 Muse,每周提供1亿令牌免费额度,并设 20 美元和 100 美元月费档

[个人助理] Meta 于9月8日推出 Muse,率先在美国向用户开放网页及手机应用,并支持通过 WhatsApp 交代任务。据彭博报道,产品由 Muse Spark 1.3驱动,每周免费额度最高 1亿令牌,另有 20 美元和 100 美元月费方案,供重度用户获得更多算力。

[离线后续办] 目前,Muse 在独立云端虚拟机上运行,配有浏览器,能围绕长期目标制订计划、跨应用处理任务。用户关闭应用后,它仍可继续工作,进展变化或需要批准时再回来通知。与一次问答相比,持续执行要求系统记住已完成的步骤,避免重复操作。

[权限分开] Meta 称,独立的 Sentinel 智能体会检查对外动作,密码和支付凭据另行存储,Muse 本身不可见。发送邮件、购买等敏感行为需要用户批准。这些机制直接关系到个人是否愿意把邮箱、日历和购物账户交给一个会自行推进工作的助手。

[免费量之外] 免费令牌数量提供了试用空间,但不能直接换算成可完成的任务数:浏览网页、反复检索和长时推理都会消耗额度。个人用户最终需要比较的是每项任务的成功率与干预次数。若仍要频繁检查和纠错,大额免费算力也未必能省下日常时间。

▪ SIGNALMuse 的大众化取决于持续执行能否可靠省事,免费令牌决定试用门槛,任务成功率决定用户是否交出更多权限。

❯ OpenAI 推出 ChatGPT Images 2.5,生成延迟最多降低 50%,新增草图与图上评论编辑

[图像升级] OpenAI 于9月8日发布 Images 2.5,称相较 Images 2.0,图像生成延迟最多降低 50%。更新覆盖 ChatGPT、ChatGPT Work 与 Codex 的桌面、移动和网页端,重点包括参考主体保留、局部修改和连续编辑的一致性。

[修改更具体] 新增 Sketch 允许用户画出构图意图,再由模型生成成品;图上评论可直接标明要改的位置。官方称,多轮修改更容易保留此前已确认的细节,同时改善光线、纹理和复杂布局。对制作海报、商品图的人而言,少改坏一处往往比首次生成更漂亮更实用。

[接口分两档] 开发接口新增 Flare 与 Sunburst两个型号。前者强调质量、编辑和速度,后者面向需要更精细控制的工作,生成时间更长。两者是不同的产品取舍,不能把最快延迟与最精细效果默认算在同一次调用上,接入前仍须按具体素材测试。

[生产环节] 内容制作团队可用同一组人物或商品图连续修改,检查背景、文字和主体细节是否稳定。只有返工次数随延迟一起下降,整套制作流程的时间成本才会下降。官方演示展示了方向,但批量素材中的长文字、品牌细节和跨图一致性仍需逐项验收。

▪ SIGNAL图像工具的效率由生成等待与修改返工共同决定,多轮编辑能否保留已确认细节,比单次速度数字更接近生产需求。

❯ 谷歌发布 AlphaGenome Atlas,以1PB 数据预计算约 90 亿种人类 DNA 单字母变异的分子影响

[全量预计算] 谷歌 DeepMind 于9月8日推出 AlphaGenome Atlas,使用 AlphaGenome 预计算约 90 亿种可能的单核苷酸变异,形成 1PB数据集。研究人员可通过网页查询,减少为每个候选变异分别运行预测的工作。

[筛选顺序] 人类基因组约有 30 亿个碱基对,其中大部分区域不直接编码蛋白质。Atlas 通过 AVI 影响评分汇总预测,帮助研究人员在编码区和非编码区之间筛选候选变异。这里的覆盖范围是单字母变化,不等于已经囊括多位点组合及所有结构变异。

[研究实例] 谷歌披露,研究团队已将评分用于罕见病候选变异排序;另一项针对 5.4 万余名英国生物样本库参与者的分析,利用预测的分子影响对变异分组,发现了更多非编码区关联。这些案例检验的是研究筛选效率,不能直接读作疾病诊断准确率。

[实验仍在后面]基因组研究团队而言,数据库最直接的用途是缩小实验范围,把有限经费投向更可能有作用的候选项。模型预测与实验结论之间仍有距离:高评分提示研究优先级,不单独证明某个变异导致疾病,也不能替代后续生物学与临床验证。

▪ SIGNAL把全基因组预测变成可查询资源,能加快候选变异排序;真正的发现仍要经过后续实验验证。

❯ DeepSeek V4.1 Flash 开启限时内测,称采用新结构并原生支持多模态,正式技术细节尚未公布

[中间版本] 据第一财经和腾讯科技报道,DeepSeek 于9月8日在官方交流群开放 V4.1 Flash中间版本内测,称新模型采用新的模型结构、原生支持多模态,并改善能力、速度与成本。这次动作是限时测试,尚不是正式版本的全面发布。

[临时接入] 通知给出的方式是保持原接口地址不变,改用带有9月10日到期字样的临时模型名;计费沿用 V4 Flash,单账号上限为 20 路并发。这个限制更适合功能验证和小规模对照,无法据此判断正式服务将提供多大的持续吞吐。

[能力边界] 公开报道尚未提供可核对的完整技术报告、参数规模及标准评测结果。因此,原生多模态应保留为通知中的产品描述,不能进一步推断它必然支持哪些输入形式,也不能给出未经测试的领先幅度。新结构与此前视觉实验版的关系仍待说明。

[评测窗口] 应用开发者可以趁测试期用已有任务对照输出质量、时延和总令牌消耗,同时保留稳定版本。通知所称成本更低,也不自动等于每项任务花费更少;长回答、重复尝试和工具失败都会增加实际调用账单,这些才是正式迁移前应验证的指标。

▪ SIGNAL限时内测提供了验证新结构的窗口,能力、速度和成本三项改善,都需要在同一套真实任务上分别测量。

❯ DeepSeek 将于9月10日中午下调 Flash 价格,缓存输入降至每百万令牌 0.02 元,高峰仍收双倍

[新价明日生效] 据开放平台公告及国内媒体转述,DeepSeek 将于北京时间 9月10日12时调整 Flash 系列价格。空闲时段每百万令牌的缓存命中输入为 0.02 元、未命中输入为 1元、输出为 4元,三项分别计费,不能混为统一调用单价。

[降幅不相同] 对比 IT之家整理的新旧价格,缓存命中输入由 0.05 元降至 0.02 元,降幅 60%;未命中输入由 1.5 元降至1元,下降约三分之一;输出由 4.5 元降至4元,下降约 11%。因此,输出较长的任务,账单降幅可能明显小于缓存密集型任务。

[高峰双倍] 高峰时段仍为工作日9时至12时、14时至18时,按北京时间计价,价格为空闲时段的 两倍。对应每百万令牌的三项价格为 0.04 元、2元和8元。批处理若能错峰执行,可与在线交互采用不同调度;实时任务则不能只按最低价格预算。

[任务账单]批量文档处理和智能体应用,缓存复用率、输入输出比例及运行时段共同决定成本。降价生效后,应以完成同一任务的总支出比较模型,而非只看缓存命中单价。V4.1 Flash 内测与此次价格公告也须分别处理,不能把新价当作正式版发布日期。

▪ SIGNAL缓存降价最多,但应用实际能省多少,仍由缓存命中率、输出长度和高峰时段占比共同决定。

❯ Claude 订阅者扩大对 Anthropic 的集体诉讼,指控 Max 的5倍与20倍用量宣传具有误导性

[订阅争议] 据 The Verge 报道,一批 Claude 订阅者在扩大的集体诉讼中,指控 Anthropic 对 Max 使用额度作出误导性宣传。争议涉及每月 100 美元和 200 美元两档套餐;相关指控仍是原告主张,不能写成法院已经认定的事实。

[倍数怎么算] Anthropic 当前帮助文档将5倍和20倍解释为相对 Pro 的每次会话额度,会话额度每五小时重置,同时另设跨模型的每周上限。订阅者能在单个窗口里多做多少,与整周能工作多久,是两种不同指标,前一个倍数不能直接套到后一个指标上。

[历史与限制] The New Stack 引述诉状报道,Max 于2025年4月推出后,公司在同年7月宣布加入每周限制,宣传仍使用5倍与20倍说法。官方文档也保留按模型和功能设置其他上限的空间。宣传承诺与限制说明是否足够清楚,是这场争议应核对的部分。

[采购的实际值] 对依赖 Claude Code 完成长时任务的付费开发者,月费之外还存在中断等待、切换工具及追加用量的成本。平台若只突出额度倍数,却不能让人预估连续工作时长,升级决策就很难做。诉讼报道不等于退款已经获准,后续仍须看案件进展。

▪ SIGNAL订阅倍数只有连同会话、每周和模型限制一起说明,才足以帮助用户判断付费后能完成多少工作。

❯ 中国规划到2030年将智能算力增至9800 EFLOPS,五年信息基础设施累计投资目标为3.8万亿元

[五年目标] 据工信部规划及《南华早报》报道,中国提出到2030年智能算力规模达到 9800 EFLOPS,2026年至2030年信息基础设施累计投资 3.8 万亿元,按报道折合约5320亿美元。后者覆盖信息基础设施建设,不能全部归入 AI 加速卡采购或单一财政投入。

[现有基数] 工信部口径显示,今年6月底智能算力为 2185 EFLOPS,同比增加 177%;相对这个基数,2030年目标约为 4.5 倍。EFLOPS 衡量每秒百亿亿次浮点运算,不能在缺少精度和统计口径的情况下,直接换算为某一种芯片的采购数量。

[集群与适配] 规划要求有序部署万卡、十万卡及以上智算集群,并加强国产算力芯片适配。工信部解读同时涉及网络基础设施升级、绿色运行和应用拓展。集群规模之外,机房电力、网络连接和软件适配决定硬件能否稳定组成可用服务。

[兑现看利用] 设备商和算力运营方获得了较长时间的建设方向,但规划目标还不是已签订单。项目价值需要在投运与使用效率上兑现:设备送进机房之后,能否被客户持续调用、收入能否覆盖电力和运维费用,会决定规模扩张最终留下多少经营收益。

▪ SIGNAL算力规模给出建设方向,订单、投运和客户使用之间的距离,决定设备投入能否转化为持续收入。

❯ DeepSeek 拟招聘约150名资深后端工程师,重写逼近承载上限的基础系统以支撑用户和智能体增长

[后端扩招] 据《南华早报》报道,DeepSeek 的 Harness 团队负责人崔天一在社交平台表示,公司拟招聘约 150 名资深后端工程师。此次扩招针对基础系统承载压力,覆盖升级、维护与重写工作,招聘目标不等于人员已经全部到岗。

[压力来源] 报道引述崔天一称,数据量、机器数量、训练任务和活跃用户均快速增长,现有后端系统正接近承载极限。多项规模一起增加会带来调度和可靠性问题。模型单次回答能力提高,也不能自动解决后台任务堆积、机器协同和服务恢复等工程负担。

[扩张延续] 公司6月已提出各部门至少扩充一倍,并开放 33 类岗位,覆盖研究、工程与产品管理。此次更聚焦资深后端人员,所需经验与单纯增加研究岗位不同:新功能上线之后,必须由长期运行的系统把能力稳定交给用户。

[服务质量]接入 DeepSeek 的企业,模型更新和价格只是选择供应商的一部分,并发、稳定性与故障恢复同样影响交付。后端重写若能减少任务失败和服务中断,才能把用户增长承接下来;招聘公告提供的是执行方向,实际改善还需用运行表现检验。

▪ SIGNAL用户增长把后端工程推到前台,扩招的成果应体现在更稳定的任务交付,而不只是更大的团队规模。

❯ 机器人仿真公司 Antioch 获3200万美元A轮融资,用云端并行验证减少实体硬件测试负担

[融资与客户] 机器人仿真公司 Antioch 宣布完成 3200 万美元A轮融资,由 Greylock 领投,加上此前种子轮,累计融资 4050 万美元。公司披露已与亚马逊 Ring 合作,将面向实体设备的验证工作搬到可并行运行的仿真环境。

[测试为何慢] 机器人更换传感器、更新控制模型或调整动作之后,往往需要设备、场地和工程师再次测试。Greylock 表示,Antioch 用真实数据校准客户硬件的仿真,再在云端运行数千次并行评估,让团队先找出弱点,再决定哪些变化值得进入实机验证。

[真实数据作用] 据 Forbes 采访,Ring 表示仿真结果与物理测试接近,包括未用于校准的场景。Antioch 并未声称可彻底取消真实数据,而是希望用较少高质量样本改进仿真精度。未参与校准的测试尤其有价值,能帮助检查系统是否只记住了一套已知场景。

[交付节奏]机器人开发团队,节省的不只是采集数据的钱,还有反复占用硬件与场地的时间。仿真越能提前暴露失败,实机测试排期就越可能缩短。但仿真偏差仍须由真实设备纠正,融资后的后续产品兑现取决于跨硬件和复杂场景的验证表现。

▪ SIGNAL仿真平台的价值在于提前筛出失败、减少实机验证次数,真实数据仍负责校准它与物理世界之间的差距。

❯ Arm 发布 Neoverse CSS N4 半定制平台,支持每芯粒8至128核和最高3.8 GHz频率

[平台发布] Arm 于9月8日发布 Neoverse CSS N4,面向云端与 AI 数据中心,支持每芯粒 8至128个N4 核心及最高 3.8 GHz频率。该产品是可配置的计算子系统,客户据此设计自己的芯片,不能将平台发布等同于所有成品处理器已经上市。

[设计取舍] 目前公开展示采用台积电 N3P 工艺方案,核心数量、缓存、内存和输入输出可按用途配置。官方产品页确认支持 LPDDR6内存与 PCIe 第七代连接。最高频率和最多核心数分别描述设计范围,不能据此认定128核配置必然全部运行于3.8 GHz。

[智能体负载] Arm 称,相比 CSS N3,新平台最高性能达到两倍,每瓦性能最高提高25%。这些是厂商比较口径。智能体调用工具、读取数据库与协调任务时会增加中央处理器工作量,数据搬运与任务调度也会影响整套加速系统效率,不能只看图形处理器吞吐。

[设计到投产] 云厂商和芯片设计商可以利用集成子系统减少重复集成成本,但仍要完成具体产品的设计验证与制造。选择核心密度、功耗和内存带宽时,真实工作负载应先于峰值参数:大量并行小任务与少量低时延任务,对处理器配置的要求并不相同。

▪ SIGNAL半定制平台缩短设计集成路径,最终收益仍由客户如何配置核心、内存和功耗,以及实际任务表现决定。

❯ 市场传闻 Anthropic 新一轮预训练 Fable 将于9月底或10月初发布,官方尚未确认

[发布传闻] 社交平台出现 Anthropic 下一款 Fable 可能在 9月底或10月初推出的说法,并称来自新一轮预训练。当前可见依据主要是账号转述,尚未获官方确认,具体版本名和上线安排均不宜写成确定消息。

[已知版本] 可确认的是,Anthropic 已于9月1日发布 Fable 5.1。因此,“新 Fable”的传闻应与已上线版本区分,不能让读者误以为5.1仍在等待发布。所谓预训练变化、能力跃升与预计日期,也尚缺公开技术材料支撑。

[迁移判断] 开发团队可以保留测试预算,却不宜依据传闻推迟现有项目或承诺上线时间。正式公告、可调用版本与自身任务评测出现之后,才有足够依据讨论切换;多次转载同一说法并不能增加独立证据。

▪ SIGNAL发布时间传闻可作为测试准备的线索,不能替代可调用版本和实际评测,更不应成为项目交付的前提。

❯ Robinhood 首次成为 IPO 承销商,加入智能戒指公司 Oura 的上市交易

[承销新角色] 据《华尔街日报》报道,智能戒指公司 Oura 的上市文件将 Robinhood列为承销商,这是该零售券商首次正式获得 IPO 承销角色。此举可能增强其对分配给平台客户的新股份额的影响,但不等于已经承诺具体配售数量。

[估值别混用] Oura 正推进赴美上市,此前私募融资估值约 110 亿美元。这个数字是估值参照,不能写成此次IPO将募集110亿美元;发行股数、价格和最终估值仍须以正式发行条款为准。承销商身份也不等于已经完成发行。参与发行分销、获得承销资格与最终拿到多少股票,仍是不同环节,不能只凭名单推算平台的配售能力。

[分销能力]零售经纪平台,参与承销能把客户分销能力带到发行环节;对拟上市消费硬件公司,散户渠道是机构配售之外的补充。实际获配份额决定用户能获得多少参与机会,承销资格本身不提供上市后收益保证,发行安排和用户实际认购结果仍有待后续披露。

▪ SIGNALRobinhood 能否把零售客户规模转化为发行端的分配能力,要看实际配售结果,不能只看承销商名单。