Ternary Bonsai 2 27B 开源:三元权重近无损压缩至1/9,27B 级能力保留 98.2%
Prism ML由一支 Caltech 研究团队创立,长期研究"压缩神经网络而不牺牲推理能力";Ternary Bonsai 2 27B是继 7 月首代模型之后,开源的新一代三元多模态模型。它基于 Qwen3.8-27B 构建,权重被压到三值 {−1, 0, +1},体积 5.93GB(全精度为 53.80GB,约 1/9),在 20 项基准上平均 83.9 分,保留全精度基线 98.2% 的能力,支持 262K token 上下文与图像输入。单张 RTX 5090 上解码最高约 143 tok/s,M5 Max 笔记本上约 47 tok/s。

● ModelScope:https://modelscope.cn/models/prism-ml/Ternary-Bonsai-2-27B-gguf
● GitHub:https://github.com/PrismML-Eng/Bonsai-demo/
● 官方Blog:https://prismml.com/news/bonsai-2-27b
效果案例
案例一:Cline 编码智能体
演示在 VS Code 中用 Cline 接入本地部署的模型,对一个示例 Web 项目做安全审查与修复。

案例二:Computer Use
演示根据语音指令完成一条办公流程:读取邮件、查阅 PDF、安排日程,最后回写邮件。

技术解读
Qwen3.8-27B 混合注意力底座
模型沿用 Qwen3.8-27B 的混合注意力架构:约 75% 线性注意力 / 25% 全注意力,SwiGLU MLP、RoPE、RMSNorm;262K token 上下文由以线性注意力为主干的骨架支撑。参数共 27.36B——24.35B 语言主干(64 层)+ 2.54B 词嵌入与输出头 + 0.47B 视觉塔。压缩不改变架构,仅改变权重表示。
三值权重:每 128 个共享一个缩放系数
矩阵权重每个位置只取 {−1, 0, +1} 三种值,每 128 个权重共享一个 FP16 缩放系数,三值表示端到端覆盖嵌入、注意力与线性注意力投影、MLP 投影和输出头。一个三值只携带 log₂3≈1.585 bit 信息,加上缩放系数开销,纯三值张量的理论位宽为 1.71 bit/权重;计入 0.0976% 的高精度张量后,整套语言模型的理论值是 1.72 bit/权重;实际发布的 PTQ1_0 打包为 1.76 bit/权重。作为对照,同一模型的 FP16 权重是 53.80GB,理想三值表示为 5.80GB(约 9.3 倍)。
旋转基:Hadamard 旋转与激活侧变换
所有权重存于一个固定的旋转基中:对权重按块做 Hadamard 旋转(块大小 1024,配一组固定的 ±1 符号),旋转折进存储;推理时对激活做一次匹配变换,等价于 f(x) = W(Rx)。运行时只需对激活做一次 Walsh–Hadamard 变换(复杂度 O(n log n),远小于其后的矩阵乘),而权重本身以三值形式参与计算。这套"旋转权重基"是它区别于常规逐通道量化的关键机制。
自定义 kernel 与运行时要求
现有低比特推理路径主要面向标准全注意力 Transformer,覆盖不了线性/全注意力交替的混合结构,因此官方为 Apple Silicon 与 CUDA 编写了自定义 kernel,直接在打包的三值权重上计算、不还原成 FP16——这是让低位宽真正转化为显存带宽优势的前提。GGUF 两个打包都需要 PrismML 的 llama.cpp 分支(prism-b10658 或更新版本)。
长程任务
官方首次在 Terminal-Bench 2.1 与 SWE-bench Verified 上评测:Ternary Bonsai 2 27B 分别得到 52.8 与 60.8,约为全精度基线(69.7 / 80.6)的四分之三;τ²-Bench 为 80.2(上一代 73.6),BFCL v3 为 74.9,长上下文推理 AA-LCR 为 77.0,距全精度 1 分以内。官方称,这个体积档位的低比特模型在长程评测中往往直接无法推进任务,常规量化还会导致智能体表现塌方,而它仍能持续完成端到端软件工程流程。
同时官方用"智能密度"衡量单位体积的可用智能:把平均分折算成错误率取对数,再除以体积(GB)。Ternary Bonsai 2 27B 为 0.444/GB,IQ2_XXS 为 0.276/GB,FP16 基线为 0.051/GB。相比上一代三元 Bonsai 27B 与全精度 95% 的保留差距,这一代收窄到 98.2%,官方将其称为"实用意义上的接近无损"。
模型下载与推理
模型下载
modelscope download --model prism-ml/Ternary-Bonsai-2-27B-gguf \
--local_dir ./Ternary-Bonsai-2-27B-gguf
仓库内含 PTQ10 与 PQ20 两个打包、F16 参考版,以及两个视觉投影器(mmproj-Q8_0 0.63GB / mmproj-BF16 0.93GB);只需部分文件时可用 --include 指定。
推理脚本
Windows (PowerShell)
git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
./setup.sh # 拉取权重(PQ2_0 + 视觉投影器,约 7.8GB)与对应平台的 llama.cpp 二进制
./scripts/start_llama_server.sh # 启动后打开 http://localhost:8080
Windows 使用 setup.ps1 与 start_llama_server.ps1。脚本会顺带装好聊天界面与代码解释器,可用 BONSAI_OPENWEBUI=0、BONSAI_CODE_INTERPRETER=0 跳过。运行时二进制来自 PrismML 分支的预编译发布,请使用 prism-b10658 或更新版本;权重与二进制按官方发布版本拉取,如需手动运行,可用分支自带 llama-cli:
./bin/llama-cli -m Ternary-Bonsai-2-27B-PQ2_0.gguf \
-ngl 99 -fa on -c 32768 \
--temp 1.0 --top-p 0.95 --top-k 20 \
-p "Explain quantum computing in simple terms." -n 256
macOS / Linux
git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
./setup.sh
./scripts/start_llama_server.sh
更多推荐




所有评论(0)