2026-08-20 09:19
阿里5nm RISC-V芯片原生跑通270亿参数大模型
文章提及的 AI 工具阿里巴巴M6
文本核心速览
- 旗舰规格打破纪录—玄铁C950采用台积电5nm工艺,集成64核,主频3.2GHz,单核SPECint2006超70分,刷新RISC-V CPU性能纪录。
- 原生跑通270亿参数模型—芯片原生运行通义千问3.8-27B,无需GPU或模拟层,解码速度30 token/s,首Token延迟1.9秒,为RISC-V首次驱动此规模模型。
- 片上加速与高带宽支撑—集成矩阵与向量加速引擎,访存带宽较前代提升4倍以上,无需16至24GB独立显存即可独立完成端侧推理。
- 全栈自主开辟新路径—依托RISC-V开源特性,阿里实现从芯片、云到模型的全链路自主可控,可按硬件特性深度定制算子和指令集,降低AI推理成本。
阿里5nm RISC-V芯片原生跑通270亿参数大模型
近日,阿里巴巴达摩院迎来关键里程碑:其旗舰级CPU玄铁C950成功原生运行通义千问3.8-27B大模型。这意味着RISC-V架构芯片在不依赖GPU、无模拟层的条件下,首次直接驱动270亿参数量级AI模型。
玄铁C950硬件规格
作为64位服务器级处理器,玄铁C950采用台积电5nm工艺制造,集成64个计算核心。每8核一组通过高速AMBA CHI总线互联,主频最高3.2GHz。同时具备:
- 8指令译码宽度
- 16级流水线设计
- 片上矩阵加速引擎与向量加速引擎
- 访存带宽较上一代玄铁C920提升超4倍
得益于这些设计,其单核通用性能在SPECint2006基准测试中突破70分,刷新全球RISC-V CPU性能纪录。
运行表现与对比
在搭载通义千问3.8-27B模型时,玄铁C950解码速度达每秒30个Token,首Token延迟控制在1.9秒以内。传统上,运行此类规模模型需要16GB至24GB独立显存,而该CPU仅凭本体及片上加速引擎即可独立完成推理,免去外接独立显卡的繁琐配置。
业内认为,这一突破展示了RISC-V架构在AI推理场景的巨大潜力。
生态与战略意义
RISC-V的开源特性赋予其独特战略优势。与x86/ARM需支付高昂授权费不同,阿里巴巴全面掌控千问模型家族、云计算基础设施与玄铁芯片架构,实现从底层芯片到顶层模型推理的全链条自主可控。这种垂直整合意味着:
- 模型算子可根据硬件特性深度重新设计
- 后续芯片能基于生产环境实际数据定制专用指令集
- 为AI基础设施多元化发展开辟新路
长远来看,软硬件协同设计有望大幅降低AI推理成本,并推动RISC-V生态走向高性能计算领域。随着玄铁C950的落地,RISC-V不再局限于物联网或嵌入式场景,而是向服务器与AI训练/推理市场发起有力冲击。
(注:以上信息基于公开新闻整理,具体规格以官方发布为准。)
来源: aibase阅读原文