PrismML 发布 Ternary Bonsai 2 27B,用三元权重(-1/0/+1)加 FP16 分组缩放将 27B 模型压缩到 5.9GB,体积缩小 9 倍以上,保留全精度版本 98.2% 的基准性能,以 Apache 2.0 协议开源,可在 NVIDIA GPU 和苹果设备上运行。
PrismML 发布了 Ternary Bonsai 2 27B,这是 Bonsai 系列第二代模型,基于 Qwen3.8 27B 构建。两个月前,PrismML 发布过首代 Bonsai 27B,证明 27B 规模的多模态模型可以被压缩到能在本地设备上高效运行。Bonsai 2 27B 保持相同部署定位,同时提升了推理、编程、视觉和 agentic 能力。
压缩的核心方法是三元权重(ternary weights),取值只有 {-1, 0, +1} 三种,配合 FP16 分组缩放(group-wise scaling),使每个权重的有效比特数降到 1.76 bit。这种低比特表示端到端应用在整个语言模型上,最终模型总体积只有 5.9GB,比全精度版本小 9 倍以上。模型支持 262K token 上下文窗口,能处理文本和图像输入,以 Apache 2.0 协议开源。
在覆盖推理、数学、编程、指令遵循、视觉和 agentic 工具调用的基准套件上,Ternary Bonsai 2 27B 综合得分 83.9,相当于保留了全精度版 Qwen3.8 27B 聚合性能的 98.2%。这一比例比上一代 Ternary Bonsai 27B 明显提升——上代保留率是 95%,这次差距缩小到不足 2 个百分点,PrismML 称其为“近乎无损”。
PrismML 强调,保留的位置比综合分数本身更关键:编程 agent、工具调用系统、多模态工作流和长链条任务对性能下降特别敏感,微小误差会在多步执行中累积放大,Bonsai 2 27B 在这些场景上的性能保留幅度较大。相比之下,其他低比特方案往往要在编程、视觉或 agentic 工具使用上做出明显牺牲才能实现可部署体积,PrismML 认为 Bonsai 2 27B 在“智能密度”上属于同类中的异类。
Ternary Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上最高可达 143 token/秒,在苹果 M5 Max 上为 46.8 token/秒。在 RTX 4090 上,每生成一个 token 仅消耗 0.714 mWh,比一个以全精度运行的 8B 模型节能 40%。编程助手能有更快的编辑-调试循环,多模态 agent 能更快迭代截图、文档和工具调用,本地长期运行的私有助手也能获得更长续航和更低能耗。
模型权重已在 Apache 2.0 协议下开放下载,可通过 CUDA 在 NVIDIA GPU 上运行,也可通过 MLX 在 Mac、iPhone、iPad 等苹果设备上运行,两条路径都依赖 PrismML 自研的低比特推理内核。压缩、评测和基准测试的完整技术细节放在一份白皮书中,PrismML 在博客中给出链接但未在正文列出具体测试环境和数据集清单。PrismML 由 Caltech 研究团队创立,获得 Khosla Ventures、Cerberus、Google 的早期支持及 Samsung 的持续支持。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断