返回新闻列表
2026-05-26 09:46

面壁智能联合清华大学发布中国首个1.58-bit大模型BitCPM-CANN

文本核心速览
  1. 首个三值大模型发布面壁智能联合清华大学及OpenBMB发布中国首个基于华为昇腾平台的1.58-bit三值大模型BitCPM-CANN,在低比特训练领域取得突破。
  2. 全链路原生开发模型从量化算子到训练算法实现全链路原生开发,基于MindSpeed与Megatron-LM搭建完整训练底座,涵盖环境适配、32K长序列支持等工程体系。
  3. 四个尺寸及显存优势推出0.5B、1B、3B和8B四个尺寸版本,推理时释放约6倍显存红利,8B模型可轻松运行于当前主流旗舰手机上。
  4. 公共基础设施开放面向昇腾的低比特训练公共基础设施已搭建完成,所有低比特训练工作均可依托该套体系,降低开发门槛并加速技术迭代。
  5. 模型权重全面开源BitCPM-CANN所有模型权重已在HuggingFace和ModelScope平台开源,鼓励开发者基于此工具进行更多AI创新应用。

中国首个昇腾三值大模型开源,8B参数能跑手机,显存省6倍

面壁智能联合清华大学及 OpenBMB 开源社区,正式发布并开源了中国首个基于华为昇腾平台训练的三值(1.58-bit)大模型 ——BitCPM-CANN。 该模型在低比特大模型训练领域被一些开发者视为“国产AI的一个节点”,表示中国在这块不再完全依赖英伟达。 BitCPM-CANN 实现了从量化算子到训练算法的全链路原生开发,群里有工程师说“终于不用硬改开源代码来适配国产卡了”。 模型分为 0.5B1B3B8B 四个尺寸,性能对照全精度家族 MiniCPM4 做了逐项评测,结果被参与测试的人描述为“能用,不丢点”。 推理阶段能释放约 6倍 的显存红利,这意味着一个 8B 参数的模型可以直接塞进当前主流旗舰手机里,相当于把一台服务器压到手掌大小。

训练底座被公开,低比特开发有“公共货架”

据参与项目的开发者说,面壁智能基于 MindSpeed 与 Megatron-LM 搭建了完整的低比特训练底座,覆盖环境适配、32K 长序列支持、并行策略、融合算子等工程体系。 群里在传,今后所有面向昇腾的低比特训练工作都可以直接拿这套基础设施起步——不用重复造轮子。 这被圈里人评价为“降低了门槛,也加速了迭代”,尤其对硬件厂商来说省了不少适配的弯路。

权重已全量开源,接下来该盯着啥

BitCPM-CANN 的所有模型权重都已开源,用户能通过 HuggingFace 和 ModelScope 直接下载。 有开发者试了说,这个工具链已经能跑典型任务,但长序列下还有优化空间。 接下来可以盯着看,这套公共底座能否拉拢更多国产芯片(比如寒武纪、天数智芯)跟进同样的低比特训练方案。 这会让依赖 NVIDIA 显卡做训练的小团队和个体开发者受益——如果能用便宜得多的国产卡跑起 8B 模型,成本直接砍半。而传统的全精度大模型厂商可能会难受,因为三值模型在手机端落地后,云端推理的需求就少了。

来源: aibase阅读原文

其他新闻

查看全部