核心导读
如果 AI 实验室 PrismML 尚未进入你的视野,那它值得你关注——原因并不是它已融到巨额资金(目前还没有,仅完成 2225 万美元种子轮),而是其背后的技术人才,以及它正在开发的、可能改变行业格局的技术。
PrismML 押注的是:能力强、性能高、具备推理能力的大语言模型,实际上并不一定非要“大”。
它正在把推理模型做到小到可以装进 PC 和智能手机。(甚至有传言称它正与苹果洽谈,但 CEO 巴巴克·哈西比(Babak Hassibi)拒绝对 TechCrunch 置评。)
周四,PrismML 发布了 Bonsai 2 27B,这是其模型家族中的最新成员。它将阿里巴巴广泛使用的开源模型 Qwen3.8 27B 压缩至 5.9 GB,小到足以装进一台 PC,甚至可能装进高端智能手机。相比原模型,其内存占用降至原来的约 1/9 至 1/10。
PrismML 由一群加州理工学院研究人员创立,由哈西比领导。他是加州理工学院教授,也是压缩技术专家。这家初创公司还邀请伊昂·斯托伊卡(Ion Stoica)担任顾问。斯托伊卡是 Databricks(以及其他公司)的联合创始人,也是伯克利著名的 Sky Computing Lab 主任,该实验室孕育了从 Letta 到 SGLang 的众多技术和初创公司。
PrismML 还获得了 Khosla Ventures、Cerberus Capital 和加州理工学院的投资。
这家初创公司当然不是唯一研发 LLM 压缩技术的公司。由西班牙多诺斯蒂亚国际物理中心一位知名教授创立的 Multiverse Computing 也是其中之一。(而且 Multiverse Computing 已融到巨额资金。)
但哈西比表示,PrismML 的压缩技术独一无二,因为其 LLM 与原模型相比几乎没有任何性能损失。Bonsai 2 在 Qwen 的综合基准测试得分上达到 98%。这较几个月前、3 月发布的第一代 Bonsai 的 95% 有所提升。公司称,第一代模型已被下载超过 1100 万次,而 PrismML 更小的模型又被下载了 260 万次。
因此,这表明 PrismML 的压缩效果在一次次发布中不断提升。它能否最终实现 100% 的基准性能持平,仍有待观察。哈西比表示,压缩很可能总会带来一些影响。
不过,完美的基准持平在某种程度上只是学术问题。LLM 在未压缩状态下也并非如此精确,基准测试也并非完美反映实际任务,因此 2% 的性能下降不太可能显著影响模型在实际使用中的表现。(此外,周边软件——模型运行所依赖的框架——对准确率也有很大影响。)
PrismML 表示,它通过缩小构成模型的“权重”来实现这一点——权重本质上是模型在训练期间学习和存储的信息。通常,每个权重需要 16 位。PrismML 的方法被称为“三值”权重,将其简化为三种取值:+1、−1 或 0。由于每个权重需要存储的值小得多,模型占用空间大幅减少。(如需深入了解该压缩技术,可参见该项目的 GitHub 页面。)
这家初创公司的下一个目标是将这种压缩技术应用于更大的模型。哈西比告诉 TechCrunch:“我们接下来将发布的模型,希望是在未来几个月内,参数规模将达到数千亿级别,我预计在那里更容易保留智能。”
他补充说,随着模型规模增长,“在不损失智能的情况下进行压缩的空间更大。所以我会说,作为一个总体趋势,对于更大的模型,达到 100% 会更容易。”
斯托伊卡告诉我们,他对这项技术感到兴奋,因为它让先进模型能够在用户设备上运行。“智能将触手可及,而且它是免费的,因为它将在你已经购买的设备上运行。它也将是私密的,因为你不需要把它发送到云端。”
