返回 AI Daily 首页
2026-09-22-星期二 · #小米MiMo · #OpenAI · #Grok4.7 · #Harvey · #Nscale · #SBEnergy · #ZCode · #DeepSeek · #Qwen · #Oura · #GPT6Astra · #Jev · #OpenRouter · #KimiCode · #iPhone18ProMax

❯ 小米开源 MiMo-V2.6 Pro 与 Flash,独立榜单将 Pro 列为最强开放权重模型

[模型发布] 小米发布并开放 MiMo-V2.6 ProFlash 权重,同步给出技术报告和强化学习研究资源。公司称新系列可处理文本、图像和音频输入,并已在开放平台提供调用,接口价格维持不变。

[榜单口径] 相比上一代产品,目前独立评测机构 Artificial Analysis 将 Pro 评为其智能指数中 得分 46 的最高分开放权重模型,并测得每项指数任务成本约 0.13 美元。这支持“在该榜单领先”,却不等于在全部任务上压过 Claude Opus 5 或 GPT-5.6 Sol;小米所称的多项智能体测试接近两者,仍应按具体测试环境理解。

[开放路径] Pro 与 Flash 一大一小,把高能力和较低部署门槛同时交给开发者。应用公司的模型选择因此多了一个能下载、微调和自行部署的候选,而不必只比较封闭接口价格;真正的采用量还要看稳定性、推理成本与实际任务表现,以及长期维护和迁移的工作量。

▪ SIGNAL开放权重的竞争已从“能否追上”转向“能否在同等任务效果下把部署和调用成本压低”。

❯ OpenAI 称内部模型解决逾百道开放数学问题,成立独立顾问组讨论成果发布

[研究披露] OpenAI 在 9 月 21 日公告中称,自 8 月 28 日启动训练的新内部模型已解决 逾百道长期开放数学问题,范围跨越多个数学分支。公司同时承认进展速度令内部数学家意外,因而与数学界讨论如何披露结果。

[顾问职责] 根据 OpenAI 公告,目前一个由九名数学家组成的 独立顾问组将就成果审阅、重要性判断、发布协调及学术规范提供意见。成员不由 OpenAI 付薪,可以主动发表批评;但公司明确表示,顾问组不负责决定内部研发节奏。这与先前公布单项证明后由同行逐步检验,属于不同层面的安排。

[证据边界] 公告给出总量声明,却没有同时公开这一百多道问题的逐题清单与证明。数学界的独立核验需要先看具体命题、既有文献与完整推导;目前可以报道公司的声明和治理安排,不能把每一项都写成已经获得外部确认的定理。接下来要看顾问组能否推动逐题披露,以及外部同行如何评价这些题目的难度。

▪ SIGNAL公开可审查的命题和证明,才会把惊人的内部解决数量变成数学共同体能够使用的成果。

❯ SpaceXAI 发布 Grok 4.7,维持每百万输入与输出令牌 2 美元、6 美元定价

[正式上线] SpaceXAI 发布 Grok 4.7,已向接口、Cursor 与 Grok Build 开放;常规上下文内每百万输入、输出令牌分别为 2 美元和 6 美元,与 Grok 4.6 的基础价格相同。官方称新模型更擅长检查自身工作和处理长任务。

[任务对照] 相比 Grok 4.6,公司把更长的强化学习训练用于耗时数小时的编码任务,并宣称新版本更能检查自身工作。目前独立评测中,搭配 Grok Build 的编码智能体指数由前代 47 升至 56;但该结果考察的是“模型加自家工具”的组合,不能直接拿来代表所有编程环境中的模型能力,也不能替代企业自己的项目回归测试。

[采购判断] 对使用长任务智能体的团队,单位任务完成成本比单次令牌报价更要紧。新版本在同价位提供更强任务表现,可能改变模型路由配置;高于 20 万输入令牌的请求另有价格档,采购时不能只看首页标价,还应记录失败后重试和人工验收的费用。

▪ SIGNAL同价升级把竞争压力传给别家长任务模型,但胜负仍取决于真实项目的完成率和返工量。

❯ 彭博称 Harvey 等创业公司转向开放权重与自研模型,以降低前沿模型账单

[成本转向] 据彭博报道,法律科技公司 Harvey 以及医疗、金融领域的 Abridge、Ramp、Rogo 等创业公司正尝试开放权重模型或训练自有模型,减少对少数前沿实验室接口的依赖。报道描述的是不同公司的多条技术路径,并非它们已经全面停用封闭模型。

[利润压力] 在过去依赖前沿模型接口的垂直行业应用中,模型调用既是产品能力来源,也是随用户量扩张的直接成本。若可重复、范围明确的任务交给更便宜的模型处理,复杂问题仍路由给顶级模型,毛利率与响应速度都有调整空间;代价是公司必须自己承担评测与托管和质量控制,还要确保法规要求下的准确性。

[竞争位置] 这些公司真正争夺的是工作流和领域数据,而非通用模型排行榜。前沿模型供应商的议价能力会受到路由比例影响:客户越能证明某类任务可由开放模型完成,续约时就越有替代选择。但自建模型若在关键任务中错误率上升,节省的接口费用可能很快被人工复核吃掉。

▪ SIGNAL垂直应用的护城河若建立在业务流程而非独家模型上,模型账单就更可能成为可谈判的采购项。

❯ Nscale 招股书披露 1034 亿美元合同总额,活跃合同仅约 26 亿美元

[合同结构] 算力基础设施公司 Nscale 的招股书显示,截至 8 月底,活跃及已签约合同总价值约 1034 亿美元,其中实际活跃部分约 26 亿美元。据彭博报道,微软与 Anthropic 合计贡献约 85% 的合同总额,客户集中度很高。

[不能混算] 根据招股书,目前合同总价值覆盖未来多年预期交付,加权平均合同期约 5.7 年;它不是已实现收入,也不是全部机柜现已通电。已签项目还需建设、电力、芯片采购和融资逐项兑现,活跃部分仅占总额约 2.5%。在这些条件满足之前,把未来合同与当期营收并列,会高估业务兑现进度。

[上市考题] 投资者要核算的不是订单标题有多大,而是 Nscale 的交付速度与融资成本。两家大客户若调整采购或项目时间表,未活跃合同转成收入的路径会直接改变;巨额合同在这里同时是增长证明和集中风险。招股书后的路演需要给出更多项目级建设、供电和现金流节点。

▪ SIGNAL1034 亿美元是未来交付的承诺簿,26 亿美元才是当下活跃规模;估值必须跨过两者之间的建设期。

❯ 纽约时报称软银旗下 SB Energy 推迟上市,逾 500 亿美元估值遭投资者追问

[上市延期] 据《纽约时报》引述知情人士报道,软银旗下数据中心与能源开发商 SB Energy 推迟原拟于本月进行的首次公开募股。报道指投资者质疑其寻求的 逾 500 亿美元估值;公司尚未公布新的上市时间。

[估值难题] 根据公司申报材料,目前数据中心项目的签约规模、建设进度与经营收入并不在同一时间发生。SB Energy 连接电力开发和人工智能算力需求,市场因此愿意为未来交付付价,但项目越大,融资与通电时间对估值的影响也越重。

[发行窗口] 延期并不等于项目失效,也不能据此推断发行最终价格。对软银和潜在投资者来说,可验证的项目现金流比远期订单更能缩小分歧;下一次启动路演时,建设节点与资本开支将是硬问题。

▪ SIGNAL人工智能基建公司拿订单容易讲增长,拿通电与现金流才能定发行价。

❯ 路透称智谱 ZCode 因代码上传争议停用部分功能,并公开编程框架源码

[争议与处置] 据路透报道,智谱旗下编程助手 ZCode 被用户指在未经明确同意的情况下,把本地代码库上传至境外云服务器。公司随后致歉并停用部分相关功能;代码是否触及具体企业机密,仍需逐案判断,不能从用户投诉直接推定。

[源码公开] ZCode 的桌面、网页和终端智能体框架已放上 公开代码仓库,开发者可以检查部分客户端和运行时实现。开源有助于审视上传逻辑,但不自动证明所有历史数据流、服务端处理或已安装版本都安全。

[采购后果] 企业采用编程智能体时,授权范围不该只写“可访问项目”。代码出境路径、默认开关和审计记录都需要能被实际检查;一次意外的全库上传足以让安全团队重新审视工具许可。

▪ SIGNAL编程智能体越能主动读取项目,企业就越需要把“读了什么、传到哪里”变成可核查配置。

❯ The Information 称 DeepSeek 拟用华为芯片训练,交付窗口指向今年末或明年初

[芯片计划] 据 The Information 引述知情人士报道,DeepSeek 首席执行官梁文锋向投资者表示,使用 华为芯片训练模型是公司最重要的押注之一。报道说,新一批训练芯片可能在今年第四季度或 2027 年第一季度交付;这仍是计划窗口,不是已完成部署。

[训练门槛] 相比已有的推理端替代实践,目前在出口限制下,国产芯片能否进入最大模型训练,取决于芯片数量,也取决于集群互联、软件栈和稳定运行时间。推理端的经验并不能直接证明大规模训练具备同等成熟度;训练集群的可用性才是这项押注的核心。尤其长周期训练中断后的恢复,可能直接增加总成本。

[后续观察] 若交付及训练顺利,DeepSeek 对受限进口算力的依赖可下降;若芯片到位后仍难形成稳定集群,发布时间与训练成本都可能承压。供货时间和实际训练结果仍待公司或供应方确认。即便硬件如期到位,训练软件适配的进度也会决定能否真正替换原有配置。

▪ SIGNAL国产算力能否从推理走进顶级模型训练,要看连续运行的集群表现,不看单次芯片交付。

❯ The Information 称阿里任命刘大一恒负责 Qwen 大模型项目

[负责人调整] 据 The Information 引述两名知情员工报道,阿里巴巴任命资深研究员 刘大一恒负责 Qwen 大模型项目。阿里云栖大会的公开页面也将其列为 Qwen 项目负责人;这一职务信息为报道提供了可见佐证。

[组织脉络] Qwen 团队今年经历多轮调整:关键研究者林俊旸离职,随后高管周靖人转向长期研究职责。刘大一恒 2021 年加入阿里并参与模型研发,新任命让模型项目的日常责任链更清楚。

[执行重点] 对开发者来说,人事变动本身不改变已发布权重;影响更可能体现在 模型版本节奏与开源路线。阿里需要让研究团队、应用和云平台继续同步,否则组织整合难以转成稳定产品交付。

▪ SIGNALQwen 新负责人能否稳住发布节奏,比头衔变化更快被开发者感知。

❯ Oura 拟以每股 40 至 44 美元发行 5000 万股,最高筹资 22 亿美元

[发行条款] 智能戒指厂商 Oura 与现有股东计划在美国首次公开募股中合计出售 5000 万股,询价区间为每股 40 至 44 美元。按区间上端计算,交易规模为 22 亿美元,对应约 141 亿美元市值;这些仍是拟议价格。

[资金去向] 公开文件显示,Oura 自身拟发行约 1350 万股,其余主要由现有股东出售。因而 22 亿美元不能全部算成公司新增现金。公司截至 6 月底九个月收入约 12.1 亿美元,高于上年同期约 6.98 亿美元,但同期仍有大额净亏损。

[投资者问题] 智能戒指兼具硬件销售与健康数据服务,增长故事容易讲,现金流质量却要分开看。新增发行筹资与老股退出比例会影响市场对上市目的的判断;最终发行价仍须等路演结束确定。

▪ SIGNAL高增长可支撑高询价,但投资者先要分清这笔钱有多少进入 Oura、有多少进入老股东口袋。

GPT-6 Astra 被指参与证明刘维尔版哥德巴赫命题,经典猜想仍未解决

[公开主张] 一个公开数学项目将 刘维尔版哥德巴赫命题的无条件证明归功于 GPT-6 Astra:每个大于 2 的偶数,可写成两个刘维尔函数值均为 负一的正整数之和。项目提供论文与 Lean 4 形式化文件,外部整理页面称已有独立重建。

[命题边界] 相比经典命题,目前刘维尔函数的条件与“两数均为质数”不同,因此这不是经典哥德巴赫猜想的证明。公开项目称,新结果消除了此前对广义黎曼猜想或“充分大偶数”的依赖,并用 Lean 4 写出形式化证明;形式化代码可编译支持证明链条核查,却不替代数学界对新颖性、归属和论证价值的审阅。公开模型的归因记录仍不完整。

[研究意义] 若后续复核维持结论,这是一例模型参与发现、形式化工具参与校验的工作流。AI 对证明的具体贡献还需要完整生成过程来界定;标题里不能把“弱化命题获证”缩写成“攻克哥德巴赫猜想”。独立数学家下一步需检验论文与既有结果的关系,并确认形式化陈述是否覆盖原始主张。

▪ SIGNAL这项工作最值得检验的,是模型如何找到证明路线,以及人类能否完整复现那条路线。

❯ Jev 开放注册,以低价结构化判断模型承担智能体的快速决策环节

[产品定位] TypeSafe AI 的 Jev 主打快速输出分类、路由、评分等结构化判断,而非长篇内容生成。据公司公告,输入价格为每百万令牌 0.042 美元、输出免费;用户提供的开放注册与赠送额度,具体可用范围仍以账户页面为准。

[分工实验] 据开发者公开的项目记录,目前《我的世界》实验把 GPT-6 Astra 用作高层规划器,让 Jev 选择即时动作,并记录 8 分 43 秒击败末影龙的运行结果。这是单个开发者在特定环境的演示,不是跨任务通用性能榜,也不能据此推断两家大模型公司已有同类内部产品。仓库记录能核对这一轮运行,不保证每次重复都相同。

[使用场景] 当智能体每一步都让大型推理模型作决定,延迟和费用会累计。高层规划与快速动作判断分工有机会降低循环成本,但要防止廉价判断器在边界场景持续犯错;开发者仍须评测整条任务链。尤其涉及支付、代码修改或客户资料时,低价决策应有回退和人工确认机制。

▪ SIGNAL若快速决策模型足够可靠,智能体的成本优化会从“换一个大模型”转向“把不同决策交给不同模型”。

❯ OpenRouter 数据测算显示中国模型周调用量达 67.46 万亿令牌,统计口径须谨慎

[平台数据] 《每日经济新闻》根据 OpenRouter 数据测算,9 月 14 日至 20 日全球模型调用量约 129 万亿令牌,其中中国模型约 67.46 万亿令牌,美国模型约 14.21 万亿令牌。该媒体称中国模型环比增长 10.28%,并连续 21 周高于美国模型。

[榜单变化] 相比前一周,目前报道称 DeepSeek-V4.1-Flash 单周调用约 15.8 万亿令牌,环比增 219%,位列平台榜首。但平台按模型归属统计的流量,既不等于各国所有模型服务的总调用,也不等于本土实际使用量;各厂商自有渠道不一定进入样本。一次路由或免费活动变化,也会使短期份额波动。

[商业读法] 这组数据能观察开发者在一个重要路由平台上的偏好变化,却不能单独证明一国的总体算力、收入或技术领先。跨平台的实际付费使用与调用令牌数之间仍隔着价格、免费额度和任务类型。要判断需求是否稳固,还应跟踪后续数周的留存、付费和任务分布。

▪ SIGNAL令牌份额能展示模型被试用和调用的热度,商业份额还要看谁付费、按什么价格付费。

❯ Kimi Code Desktop 登陆苹果与 Windows 桌面,将编程智能体装进可视化工作台

[桌面发布] 月之暗面的 Kimi Code Desktop 已提供 macOS 苹果芯片、英特尔版及 Windows 版。官方更新日志标注正式发布日为 9 月 17 日;本周中文媒体再度报道,不应误写成 9 月 21 日才首次上线。

[操作路径] 用户在图形界面打开项目后,可以让智能体读写代码、运行命令,并查看每轮工具调用和文件改动。内置 终端与浏览器,还支持先审计划、敏感操作审批及后台长任务;它把原先终端里的编程工作流搬到可见窗口。

[采用门槛] 开发者的审阅成本决定桌面端是否真能拓宽用户群:看得见改动、能在关键步骤批准,比单纯把命令行包装成聊天框更重要。团队仍需核对权限模式和项目数据范围。

▪ SIGNAL编程智能体走向桌面后,竞争点会落在任务可见性、审批与改动审阅,而不只是模型回答速度。

❯ 第三方测试称 1TB 版 iPhone 18 Pro Max 持续写入掉速,结论限于极端负载

[实测发现] 第三方频道 Homolab 测试一台 1TB 版 iPhone 18 Pro Max,报告其 QLC 闪存在长时间重写入后明显掉速。与测试中的 512GB TLC 机型相比,两者部分读取表现接近,差异主要出现在缓存耗尽后的持续写入。

[缓存机制]512GB TLC 配置相比,QLC 每个单元存更多数据,有利于提高容量;设备可先借助高速缓存处理短时写入。根据测试报道,目前缓存耗尽后段平均速度约 79.4MB/s,部分阶段更低,但这属于特定设备和压力测试条件,不代表所有容量、批次或日常拍摄都会如此。

[用户边界] 对经常录制长段高码率视频、搬移大量素材的人,持续写入速度可能比标称容量更重要。普通照片、应用安装和短时视频通常先经过缓存,不能直接由极端测试推导出普遍可感知的卡顿。购买前应观察独立测试在长时间写入、不同容量和高存储占用率下能否复现掉速,这会影响专业用户的容量选择。

▪ SIGNAL大容量存储的代价若只在缓存耗尽后出现,购买判断就该对准自己的连续写入时长。