前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.18 · 00:00/5 MIN/作者:苏晚/1 阅读

Bonsai 2 27B:三元权重压缩九倍,保留98.2%性能

PrismML 发布 Ternary Bonsai 2 27B,用三元权重(-1/0/+1)加 FP16 分组缩放将 27B 模型压缩到 5.9GB,体积缩小 9 倍以上,保留全精度版本 98.2% 的基准性能,以 Apache 2.0 协议开源,可在 NVIDIA GPU 和苹果设备上运行。

三元权重如何做到 9 倍压缩

PrismML 发布了 Ternary Bonsai 2 27B,这是 Bonsai 系列第二代模型,基于 Qwen3.8 27B 构建。两个月前,PrismML 发布过首代 Bonsai 27B,证明 27B 规模的多模态模型可以被压缩到能在本地设备上高效运行。Bonsai 2 27B 保持相同部署定位,同时提升了推理、编程、视觉和 agentic 能力。

压缩的核心方法是三元权重(ternary weights),取值只有 {-1, 0, +1} 三种,配合 FP16 分组缩放(group-wise scaling),使每个权重的有效比特数降到 1.76 bit。这种低比特表示端到端应用在整个语言模型上,最终模型总体积只有 5.9GB,比全精度版本小 9 倍以上。模型支持 262K token 上下文窗口,能处理文本和图像输入,以 Apache 2.0 协议开源。

性能保留与横向对比

在覆盖推理、数学、编程、指令遵循、视觉和 agentic 工具调用的基准套件上,Ternary Bonsai 2 27B 综合得分 83.9,相当于保留了全精度版 Qwen3.8 27B 聚合性能的 98.2%。这一比例比上一代 Ternary Bonsai 27B 明显提升——上代保留率是 95%,这次差距缩小到不足 2 个百分点,PrismML 称其为“近乎无损”。

PrismML 强调,保留的位置比综合分数本身更关键:编程 agent、工具调用系统、多模态工作流和长链条任务对性能下降特别敏感,微小误差会在多步执行中累积放大,Bonsai 2 27B 在这些场景上的性能保留幅度较大。相比之下,其他低比特方案往往要在编程、视觉或 agentic 工具使用上做出明显牺牲才能实现可部署体积,PrismML 认为 Bonsai 2 27B 在“智能密度”上属于同类中的异类。

速度与能效

Ternary Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上最高可达 143 token/秒,在苹果 M5 Max 上为 46.8 token/秒。在 RTX 4090 上,每生成一个 token 仅消耗 0.714 mWh,比一个以全精度运行的 8B 模型节能 40%。编程助手能有更快的编辑-调试循环,多模态 agent 能更快迭代截图、文档和工具调用,本地长期运行的私有助手也能获得更长续航和更低能耗。

现在能用到吗

模型权重已在 Apache 2.0 协议下开放下载,可通过 CUDA 在 NVIDIA GPU 上运行,也可通过 MLX 在 Mac、iPhone、iPad 等苹果设备上运行,两条路径都依赖 PrismML 自研的低比特推理内核。压缩、评测和基准测试的完整技术细节放在一份白皮书中,PrismML 在博客中给出链接但未在正文列出具体测试环境和数据集清单。PrismML 由 Caltech 研究团队创立,获得 Khosla Ventures、Cerberus、Google 的早期支持及 Samsung 的持续支持。

标签:Bonsai 2 27BPrismML三元权重压缩低比特量化Qwen3.8 27B本地推理
苏晚
苏晚Su Wan

前途科技 · 前沿主笔

关注 AI 与前沿科技的观察者,前途科技前沿内容主笔。

查看全部文章

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

LoRA 让异步 RL 跨机只传几 MB:一个桶加一个代理,再靠三处设置提速 3.9 倍
置顶

LoRA 让异步 RL 跨机只传几 MB:一个桶加一个代理,再靠三处设置提速 3.9 倍

//

24小时热榜

OpenAI发布Astra for Law:面向法律行业的GPT-6模型
TOP1

OpenAI发布Astra for Law:面向法律行业的GPT-6模型

英王查尔斯召集AI巨头闭门会谈
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

英王查尔斯召集AI巨头闭门会谈

3

模式的终局:算法如何驯化了我们的创作

2小时前
模式的终局:算法如何驯化了我们的创作
4

Uber用"错误归属"机制遏制重试风暴,单次事件挡下950万请求

10小时前
Uber用"错误归属"机制遏制重试风暴,单次事件挡下950万请求
5

华为将发布昇腾960芯片,对标英伟达加速算力破局

22小时前
华为将发布昇腾960芯片,对标英伟达加速算力破局
6

Gemini对决GPT-6:差价超90%,开发者该选谁?

2小时前
Gemini对决GPT-6:差价超90%,开发者该选谁?
7

Anthropic发布生命科学计划 解锁生物研发AI限制

2小时前
Anthropic发布生命科学计划 解锁生物研发AI限制
8

AI末日究竟会是什么样:从一封辞职信到三类现实场景

10小时前
AI末日究竟会是什么样:从一封辞职信到三类现实场景
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断