返回新闻列表
2026-09-01 12:55
AI123

腾讯混元推出214GB轻量版大模型并开源,支持异构设备联合推理

腾讯混元团队于9月1日宣布推出Hy4 preview轻量版,将模型权重从接近1.5TB压缩至约214GB。该版本已上线Hugging Face和GitHub平台,支持llama.cpp、vLLM、SGLang等主流推理框架。

Hy4 preview是腾讯于8月28日发布并开源的新一代MoE(混合专家)大语言模型,总参数量770B(7700亿),激活参数49B,上下文长度达100万Token。此次压缩依托Sherry稀疏三值量化算法与MIX-STQ1_0混合精度策略两项核心技术。

Sherry稀疏三值量化算法将路由专家层权重压缩至平均1.25比特;MIX-STQ1_0混合精度策略则依据校准数据逐层决定量化位宽,敏感层保留较高精度(2.06比特IQ2_XXS),不敏感层采用更激进的STQ1_0(1.31比特)。

评测显示,压缩后的模型在主流任务上表现稳定:长文理解几乎与原始BF16模型持平,多轮长上下文检索基本处于同一水平,数学能力小幅回落。MCP Atlas得分从83.7微降至83.2,SWE-Bench multi从82.9降至81.3。

在异构设备联合推理方面,腾讯混元与prima.cpp合作验证了新方案:在一台配备单张4090的笔记本与一台四卡A4000服务器(合计80GB显存、64GB内存、分属两个局域网)上,通过异构调度将MoE层拆分分配,使214GB轻量版模型达到1.02 token/s的推理速度,比笔记本单机offload快约6倍。

来源
  1. 2026-09-02 08:17 | 界面新闻:AI早报 | 阿里云宣布Qwen3-VL-Rerank模型降价;苹果指控OpenAI“销毁证据”
    阅读原文

    阿里云宣布Qwen3-VL-Rerank模型降价 9月1日,阿里云公告,大模型服务平台百炼将于北京时间2026年8月31日10:13:53起,对北京地域Qwen3-VL-Rerank模型计费单价进行下调调整:将文本输入从0.7元/百万tokens下调至0.5元/百万tokens,多模态输入从1.8元/百万tokens下调至0.5元/百万tokens。 Anthropic同英伟达支持的Lambda签署350亿美元云计算协议 据报道,Anthropic已同英伟达支持的云服务提供商Lambda签署350亿美元云计算协议,其中涉及的数据中心正由比特币矿企兼数据中心开发商Hut8在美国得州努埃塞斯...

  2. 2026-09-01 12:31 | IT之家:1.5TB 压到 214GB:腾讯混元 Hy4 preview 轻量版发布开源,异构设备可联合推理
    阅读原文

    IT之家 9 月 1 日消息,腾讯混元团队今日宣布推出 Hy4 preview 轻量版,将 Hy4 preview 的模型权重从接近 1.5TB 压缩至约 214GB。IT之家注:Hy4 preview 是腾讯于 8 月 28 日发布并开源的新一代 MoE(混合专家)大语言模型,总参数量 770B(7700 亿),激活参数 49B,上下文长度达 100 万 Token。此次压缩依托两项核心技术:其一是 Sherry 稀疏三值量化算法,将路由专家层权重压缩至平均 1.25 比特;其二是 MIX-STQ1_0 混合精度策略,依据校准数据逐层决定每层的量化位宽,敏感层保留较高精度(2.06 比特 I...

其他新闻

查看全部