❯ 谷歌研发 Frozen v2 芯片,把 Gemini 架构直接刻进硅片
专用硅片谷歌正在设计一款内部代号 Frozen v2 的服务器芯片,专门用来更省电地跑自家 Gemini 模型,预计 2028 年推出。工程师估算,按每单位电力处理的 token 数衡量,它的效率可比最新一代 TPU 高出 6 到 10 倍。消息传出后,Alphabet 股价上涨。
把模型烧进芯片做法是把 Gemini 架构的一部分直接硬连线进硅片——模型的部分决策逻辑固化在电路里,从而砍掉大量计算和数据搬运,这正是推理功耗的主要去处。代价是灵活性:TPU 是通用的,能跑各种模型,Frozen v2 只服务 Gemini,而且只有谷歌未来的模型继续沿用同一套底层架构时才用得上。因此谷歌把它定位为 TPU 之外的补充产品线而非替代,且据报道当前更像一次试制,不打算按 TPU 的规模量产。
赌架构不变这是一次拿灵活性换能效的下注,赌注是 Transformer 这一代架构在 2028 年前不会被推翻。真正被这套方案改写的是推理成本结构:如果 6 到 10 倍的能效提升成立,谷歌在同样的电力和数据中心容量下能服务的 Gemini 请求数会拉开一个身位,电力约束正在取代芯片供给成为超大规模厂商的头号瓶颈,谁能把每瓦 token 数做上去,谁就能把价格打下去。这也是垂直整合的极致形态——只有既做模型又做芯片的公司才敢把架构焊死。
signal: 把模型刻进硅片,等于用未来三年的架构稳定性,去换今天拿不到的每瓦性能。