产品介绍

CMU(Compute & Memory Unit)集网络、存储、传输与加速于一体,面向 AI 推理加速、训练加速与 AI 云化三大场景。

第一代 CMU 产品实物图
第一代 · CMU

面向 AI 推理的数据通路加速芯片

CMU 采用硬件直通架构,由芯片直接读取 SSD 数据,并通过 RDMA 跨网络传输至目标 GPU 服务器,减少 CPU 与软件层参与。

对端 CMU 可将数据直接写入 GPU HBM 指定位置,并与 vLLM、SGLang、LMCache 等推理框架协同,优化 KV Cache 跨节点加载链路。

硬件直通架构

SSD 数据由 CMU 直接读取,绕过 CPU 和软件层,缩短数据访问路径。

RDMA 高速传输

通过 RDMA 将数据跨网络直接传输到目标 GPU 服务器上的对端 CMU。

GPU HBM 直写

对端 CMU 接收数据后直接写入 GPU HBM 指定位置,减少中间拷贝与 CPU 开销。

推理引擎协同

通过内置插件与 vLLM、SGLang、LMCache 等推理框架交互。

第二代 · CMU

开放以太网 AI 训练加速

CMU 面向 400G RDMA 高性能网络,解决以太网训练中的多路径传输、乱序处理、拥塞控制与丢包重传等问题。

基于开放的 RoCEv2 以太网标准,为大规模 AI 训练提供高带宽、低延迟的数据传输能力。

CMU400 第二代智能网卡实物图

超强网络传输

支持 GPU Direct RDMA、标准 RoCEv2、自研及开放 UEC 协议,有效解决数据丢包与拥塞问题。

高带宽低延迟

总带宽高达 2x200Gbps 甚至更高,转发速率达 250Mpps,大幅降低延迟,支持 AI 训练实时数据交互。

丰富功能集成

集成 OVS 等网络加速功能与多种 RDMA 技术,后续版本将加入 Adaptive routing 等功能。

灵活适配拓展

拥有 PCIe Gen5x16 等 Host 接口与 Virtio Net 设备类型,可与各类 AI 服务器及网络环境适配。

AI 推理加速

面向大模型与智能应用推理场景,优化 GPU 间高速数据传输与网络数据通路,降低推理延迟并提升并发处理效率。

第三代

研发中

需要了解 CMU?

欢迎联系亚格之芯,获取产品资料、方案沟通或合作信息。

商务咨询