❯ PrismML 发布 Bonsai 27B,压到 3.9GB 可跑在 iPhone 上,称苹果正在评估
模型压缩PrismML 发布 Bonsai 27B,基于阿里的 Qwen3.6 27B 压缩而来,1-bit 版本体积仅 3.9GB,可装进 iPhone 17 Pro,经 MLX 在苹果设备上原生运行,也可经 CUDA 跑在英伟达显卡上。公司 CEO Babak Hassibi 告诉美国财经媒体 CNBC,苹果「正在评估我们的技术」,但他把接触阶段形容为「非常早期」。
性能代价压缩到这个份上,关键是掉多少。据 PrismML 披露,跨 15 项基准测试,三值版本保住全精度基线的 95%,1-bit 版本保住 90%,数学项最高到 91.7%、代码项 81.9%;两个版本都带 262K 上下文窗口和多模态能力。速度上,1-bit 版本在英伟达 RTX 5090 上跑到 163 tokens/秒,在 M5 Max 上 87 tokens/秒。模型以 Apache 2.0 开源,并提供免费开发者预览 API。这家公司由加州理工的研究者创立,此前一直在小模型上打磨压缩技术,Bonsai 27B 是它第一次把这套方法推到旗舰级尺寸;背后站着 Khosla Ventures、Cerberus 和谷歌,三星也在持续支持。据 CNBC 报道,苹果和其他公司正在测这批模型的速度、能效和端上表现;苹果对此拒绝置评。
端侧算账对苹果来说,这条路线的诱惑很直接:一台不联网、不付推理费、不交出用户数据的 27B 级模型,正好落在它这些年反复承诺却一直没兑现的位置上。 端上跑模型,推理成本直接归零、数据也不出设备,正是苹果这些年反复承诺的东西。但「正在评估」和「非常早期」两个词是 CEO 自己说的,苹果一个字都没认——历史上被苹果评估过又无声无息的技术公司排得很长。这条消息真正有分量的地方在别处:27B 级模型进手机的门槛,今天被一家创业公司用压缩技术推倒了,而且开源。手机厂商要算的账,从「端上能塞多大的模型」变成「掉 10% 分数换免费和离线,划不划算」。
signal: 苹果认不认这家公司是一回事,27B 装进 iPhone 这件事已经不需要苹果同意了。