在2026骁龙峰会上,高通与PrismML合作,在骁龙AR1 Gen 1智能眼镜平台成功本地运行20亿参数的1-bit量化Bonsai视觉模型。该模型基于Bonsai 1.7B构建,内存占用约为传统4-bit模型的1/4,同容量下可容纳约4倍参数,文本Token生成速度翻倍,可实现离线识图问答、翻译、语音助手等本地交互,并改善续航与发热。
PrismML于周四发布其最新推理模型Bonsai 2 27B,该模型将阿里开源的Qwen3.8 27B压缩至5.9GB,可运行于PC及高端智能手机,内存占用减少9至10倍,基准测试得分达到原模型的98%。