30 秒快速回答
1-bit 大模型是把每个模型权重压缩到只用三个值(-1、0、+1)的极限压缩方案,以微软 BitNet b1.58 为代表、2026 年 3 月 PrismML 发布 Bonsai-8B 后正式走向商用。核心价值一句话:8B 参数模型体积从 16GB 缩到 1.15GB、体积缩小约 14 倍,普通 CPU 和手机就能跑大模型,推理能耗最高降低 82%,让 AI 第一次真正”装进口袋”。
一、1.58-bit 从哪里来?一个信息论数字
传统大模型每个权重是 16 位浮点数(FP16),8B 模型光权重就要占 16GB 内存,这就是大模型只能跑在数据中心的原因。
1-bit 方案把每个权重限制为三个值:-1、0、+1。三个状态理论上只需要 log₂(3) ≈ 1.58 bit 就能表示——这就是”1.58-bit”的由来,也是香农信息论里的最小值。
| 精度 | 权重取值 | 8B 模型大小 | 能否本地跑 |
|---|---|---|---|
| FP16 | 连续浮点 | ~16 GB | 需高端显卡 |
| INT4(GGUF 量化) | 16 个整数 | ~4.5 GB | 中端显卡 |
| BitNet b1.58 | {-1, 0, +1} | ~1 GB | CPU 即可 |
| Bonsai 8B | {-1, +1} | 1.15 GB | 手机可跑 |
二、BitNet 与 Bonsai:两大路线对比
2026 年 1-bit 赛道有两位主角:微软的 BitNet 系列(学术先驱)与 PrismML 的 Bonsai 系列(首个商用产品)。
| 维度 | BitNet b1.58(微软) | Bonsai 8B(PrismML) |
|---|---|---|
| 权重取值 | 三值 {-1, 0, +1} | 二值 {-1, +1} |
| 模型规模 | 2B-3B(官方开源) | 1.7B / 4B / 8B |
| 文件大小 | ~0.4GB(2B) | 1.15GB(8B) |
| 推理引擎 | bitnet.cpp(仅 CPU) | llama.cpp / MLX |
| 实测速度 | 100B 模型 CPU 5-7 tok/s | M4 Pro 131 tok/s、iPhone 44 tok/s |
| 开源协议 | MIT 思路 / 权重开源 | Apache 2.0 全开放 |
Bonsai 与 BitNet 最大的不同:BitNet 保留部分高精度组件(激活值、embedding),而 Bonsai 对全部参数做极端压缩,靠分组共享 scale 值(每 128 个权重共享一个缩放因子)保住精度,因此能做到体积更小、速度更快。
三、为什么 1-bit 这么快?乘法变加法
大模型推理 90% 的算力消耗在矩阵乘法(乘加运算 MAC)。1-bit 权重让乘法变得”免费”:
- 权重为 1 → 乘 1 等于原值,跳过
- 权重为 -1 → 符号翻转
- 权重为 0 → 直接跳过
整个矩阵乘退化为一堆整数加法(配合 XNOR + popcount 指令),浮点运算被彻底消灭。微软官方数据显示:bitnet.cpp 在 x86 CPU 上提速 2.37-6.17 倍、能耗降低 71.9%-82.2%;ARM CPU 提速 1.37-5.07 倍、能耗降 55.4%-70.0%。
# 伪代码示意:1-bit 矩阵乘 vs 普通矩阵乘
# 普通:y[i] = sum(a[i][k] * b[k]) # 浮点乘法
# 1-bit:y[i] = sum(ternary(a[i][k]) * b[k]) # 加法/符号翻转为主
四、本质区别:原生训练 vs 事后量化
这是初学者最容易踩的坑。把训练好的 FP16 模型事后压到 1-bit,精度会断崖式崩坏、基本不可用。BitNet 和 Bonsai 都是从零开始用 1-bit 约束训练——权重从一开始就在 {-1, 0, +1} 空间里学习,模型学会把信息编码进权重的”符号与有无”而非”大小”,因此能匹配同等规模 FP16 模型的精度。
| 事后 1-bit 量化 | 原生 1-bit 训练 | |
|---|---|---|
| 做法 | 训练后压缩权重 | 训练时就约束权重 |
| 精度 | 严重劣化 | 接近 FP16 同规模模型 |
| 代表 | 不推荐 | BitNet、Bonsai |
五、能干什么、不能干什么
适合的场景:端侧 AI Agent(本地常驻、隐私安全)、移动端轻量对话、文本摘要与分类、离线环境部署、高频低成本的 Agent 内部调用。
现实的局限:
- 目前所有 1-bit 模型均为纯文本,多模态能力尚未验证
- 最大只做到 8B,70B+ 超大尺度表现仍是理论假设
- Bonsai 官方数据尚缺独立第三方基准验证,生产使用前建议自行测试
总结与延伸阅读
1-bit 大模型用信息论极限换来了体积、速度、能耗的三重革命,让”8B 模型装进口袋”从口号变成现实。如果做端侧应用或 Agent 本地化,值得重点关注 Bonsai 系列;追求极致精度则仍以云端大模型为主。
延伸阅读:本站的《什么是模型量化?把大模型变小的核心技术》《什么是小模型(SLM)?端侧AI时代的轻量级智能引擎》可对照阅读;进阶可看微软 BitNet 论文(arXiv:2402.17764)与 bitnet.cpp 官方仓库。