2026-07-24 09:06
Acrab发布边缘AI芯片GΞLIX 1:5nm制程650TOPS,本地跑千亿参数大模型
文本核心速览
- 5nm制程650TOPS算力—Acrab发布首款边缘AI SoC GΞLIX 1,基于5nm制程,集成20核CPU、3TFLOPS GPU及独立NPU,AI总算力达650TOPS,可本地运行千亿参数大模型。
- 预填充性能7.5倍于M4 Pro—在Gemma 26B模型、10k Token输入测试中,GΞLIX 1预填充速度达1416.8 Token/s,是苹果M4 Pro Mac Mini的7.5倍,通过矢量硬件加速Transformer注意力机制。
- 大容量缓存与高带宽内存—芯片配备8MB L1缓存、768GB/s共享L2带宽,外挂256位LPDDR5X内存(8533 MT/s),专为100B模型端侧推理优化权重读取与KV Cache存取。
- 完整软件栈与Agent Box参考设计—Acrab同步推出覆盖底层驱动到应用框架的软件栈,并发布首款终端设备Agent Box作为GΞLIX 1参考实现,供开发者评估与原型验证。
Acrab 发布边缘 AI 芯片 GΞLIX 1:5nm 制程撑起 650TOPS,本地跑通千亿参数大模型
一家名为 Acrab 的初创公司宣布推出其首款边缘 AI 终端 SoC——GΞLIX 1。该芯片基于 5nm 制程,采用异构计算架构,旨在让 1000 亿参数规模的大模型能够在本地直接运行,无需将数据发送至云端。
硬件架构与算力
GΞLIX 1 集成了以下核心组件:
- 20 核 Arm CPU
- 3 TFLOPS 的 GPU
- 独立 NPU
- 音视频处理引擎
其 AI 总算力达到 650 TOPS,显著高于当前主流边缘芯片。作为对比:
- 高通骁龙 X Elite 的 NPU 算力约为 45 TOPS
- 英特尔酷睿 Ultra 系列的 NPU 算力在 40 TOPS 左右
GΞLIX 1 的 AI 算力约为这些产品的十几倍。
缓存与内存子系统
为满足大模型推理的高吞吐需求,缓存与内存子系统经过专门设计:
- 8MB L1 缓存
- 共享 L2 缓存带宽:768 GB/s
- 外挂 256-bit 位宽 LPDDR5X 内存,传输速率 8533 MT/s
大模型推理时,权重读取和 KV Cache 存取对内存带宽敏感,这套配置为 100B 模型 的端侧部署提供了基础。
预填充性能:1433 Token/s
Acrab 重点展示了其在 预填充阶段 的性能表现——即大模型在生成首个 token 之前对整段输入进行全量编码的过程。通过矢量硬件单元加速 Transformer 注意力机制,并针对性优化预填充路径,官方测试数据如下:
- 配置:Gemma 26B A4B,40k KV 缓存,10k Token 输入
- 预填充速度:1416.8 Token/s
- 对比:苹果 M4 Pro Mac Mini 约为该速度的 1/7.5(即 GΞLIX 1 是其 7.5 倍)
软件栈与参考设计
软件层面,Acrab 同步推出了完整软件栈及智能体参考设计,覆盖从底层驱动到上层应用框架。首款终端设备 Agent Box 作为 GΞLIX 1 的参考实现,供开发者评估与原型验证。
行业意义
GΞLIX 1 的发布标志着边缘 AI 芯片性能的重大飞跃,使得千亿参数大模型的本地部署成为可能,在隐私保护、低延迟和离线场景下具有显著优势。随着软件生态的完善,该芯片有望推动边缘 AI 应用进入新阶段。
参考:Acrab 官方发布信息。
来源: aibase阅读原文