04 MODEL
❯ 梁文锋闭门会透露 DeepSeek 在训 2 万亿参数模型,计划做到 8 万亿
闭门会内容据知情人士,DeepSeek 周日召开一场线下闭门会,要求投资者赴北京或杭州办公室参会,首席执行官梁文锋线上接入。他称公司正在训练 2 万亿参数的模型,规模超过现有 1.4 万亿参数的旗舰 V4,并计划开发 8 万亿参数的模型。
防泄露规格会议保密措施罕见:投资者须上交电子设备与随身包袋,只提供纸笔记录。背景是此前梁文锋一场约 3 小时 44 分钟的投资人会议内容曾整段外流,DeepSeek 当时正处于融资关键期,第二轮融资一度因此暂停。据此前报道,公司今年 6 月完成首轮约 74 亿美元外部融资,第二轮估值约 5000 亿元人民币。
从效率派到规模派DeepSeek 过去的名片是”用更少的算力做出同等的模型”,2 万亿、8 万亿这组数字说明它正加入参数规模竞赛。与同日阿里 5 万亿至 10 万亿的目标放在一起看,中国头部实验室的竞争维度正从训练效率转向绝对规模。真正吃紧的是国产算力的供给节奏——8 万亿参数的训练量,靠现有的约 2 万张 H 系列等效算力显然撑不住,这也解释了它此前为何把融资大头投向自建数据中心。
▪ SIGNAL以省算力出名的公司开始报万亿级参数,中国大模型的竞争单位已经从效率换成了规模。