30 秒快速回答

1-bit 大模型是把每个模型权重压缩到只用三个值(-1、0、+1)的极限压缩方案,以微软 BitNet b1.58 为代表、2026 年 3 月 PrismML 发布 Bonsai-8B 后正式走向商用。核心价值一句话:8B 参数模型体积从 16GB 缩到 1.15GB、体积缩小约 14 倍,普通 CPU 和手机就能跑大模型,推理能耗最高降低 82%,让 AI 第一次真正”装进口袋”。

一、1.58-bit 从哪里来?一个信息论数字

传统大模型每个权重是 16 位浮点数(FP16),8B 模型光权重就要占 16GB 内存,这就是大模型只能跑在数据中心的原因。

1-bit 方案把每个权重限制为三个值:-1、0、+1。三个状态理论上只需要 log₂(3) ≈ 1.58 bit 就能表示——这就是”1.58-bit”的由来,也是香农信息论里的最小值。

精度 权重取值 8B 模型大小 能否本地跑
FP16 连续浮点 ~16 GB 需高端显卡
INT4(GGUF 量化) 16 个整数 ~4.5 GB 中端显卡
BitNet b1.58 {-1, 0, +1} ~1 GB CPU 即可
Bonsai 8B {-1, +1} 1.15 GB 手机可跑

二、BitNet 与 Bonsai:两大路线对比

2026 年 1-bit 赛道有两位主角:微软的 BitNet 系列(学术先驱)与 PrismML 的 Bonsai 系列(首个商用产品)。

维度 BitNet b1.58(微软) Bonsai 8B(PrismML)
权重取值 三值 {-1, 0, +1} 二值 {-1, +1}
模型规模 2B-3B(官方开源) 1.7B / 4B / 8B
文件大小 ~0.4GB(2B) 1.15GB(8B)
推理引擎 bitnet.cpp(仅 CPU) llama.cpp / MLX
实测速度 100B 模型 CPU 5-7 tok/s M4 Pro 131 tok/s、iPhone 44 tok/s
开源协议 MIT 思路 / 权重开源 Apache 2.0 全开放

Bonsai 与 BitNet 最大的不同:BitNet 保留部分高精度组件(激活值、embedding),而 Bonsai 对全部参数做极端压缩,靠分组共享 scale 值(每 128 个权重共享一个缩放因子)保住精度,因此能做到体积更小、速度更快。

三、为什么 1-bit 这么快?乘法变加法

大模型推理 90% 的算力消耗在矩阵乘法(乘加运算 MAC)。1-bit 权重让乘法变得”免费”:

  • 权重为 1 → 乘 1 等于原值,跳过
  • 权重为 -1 → 符号翻转
  • 权重为 0 → 直接跳过

整个矩阵乘退化为一堆整数加法(配合 XNOR + popcount 指令),浮点运算被彻底消灭。微软官方数据显示:bitnet.cpp 在 x86 CPU 上提速 2.37-6.17 倍、能耗降低 71.9%-82.2%;ARM CPU 提速 1.37-5.07 倍、能耗降 55.4%-70.0%。

# 伪代码示意:1-bit 矩阵乘 vs 普通矩阵乘
# 普通:y[i] = sum(a[i][k] * b[k])   # 浮点乘法
# 1-bit:y[i] = sum(ternary(a[i][k]) * b[k])  # 加法/符号翻转为主

四、本质区别:原生训练 vs 事后量化

这是初学者最容易踩的坑。把训练好的 FP16 模型事后压到 1-bit,精度会断崖式崩坏、基本不可用。BitNet 和 Bonsai 都是从零开始用 1-bit 约束训练——权重从一开始就在 {-1, 0, +1} 空间里学习,模型学会把信息编码进权重的”符号与有无”而非”大小”,因此能匹配同等规模 FP16 模型的精度。

  事后 1-bit 量化 原生 1-bit 训练
做法 训练后压缩权重 训练时就约束权重
精度 严重劣化 接近 FP16 同规模模型
代表 不推荐 BitNet、Bonsai

五、能干什么、不能干什么

适合的场景:端侧 AI Agent(本地常驻、隐私安全)、移动端轻量对话、文本摘要与分类、离线环境部署、高频低成本的 Agent 内部调用。

现实的局限

  • 目前所有 1-bit 模型均为纯文本,多模态能力尚未验证
  • 最大只做到 8B,70B+ 超大尺度表现仍是理论假设
  • Bonsai 官方数据尚缺独立第三方基准验证,生产使用前建议自行测试

总结与延伸阅读

1-bit 大模型用信息论极限换来了体积、速度、能耗的三重革命,让”8B 模型装进口袋”从口号变成现实。如果做端侧应用或 Agent 本地化,值得重点关注 Bonsai 系列;追求极致精度则仍以云端大模型为主。

延伸阅读:本站的《什么是模型量化?把大模型变小的核心技术》《什么是小模型(SLM)?端侧AI时代的轻量级智能引擎》可对照阅读;进阶可看微软 BitNet 论文(arXiv:2402.17764)与 bitnet.cpp 官方仓库。