产品介绍
CMU(Compute & Memory Unit)集网络、存储、传输与加速于一体,面向 AI 推理加速、训练加速与 AI 云化三大场景。

面向 AI 推理的数据通路加速芯片
CMU 采用硬件直通架构,由芯片直接读取 SSD 数据,并通过 RDMA 跨网络传输至目标 GPU 服务器,减少 CPU 与软件层参与。
对端 CMU 可将数据直接写入 GPU HBM 指定位置,并与 vLLM、SGLang、LMCache 等推理框架协同,优化 KV Cache 跨节点加载链路。
硬件直通架构
SSD 数据由 CMU 直接读取,绕过 CPU 和软件层,缩短数据访问路径。
RDMA 高速传输
通过 RDMA 将数据跨网络直接传输到目标 GPU 服务器上的对端 CMU。
GPU HBM 直写
对端 CMU 接收数据后直接写入 GPU HBM 指定位置,减少中间拷贝与 CPU 开销。
推理引擎协同
通过内置插件与 vLLM、SGLang、LMCache 等推理框架交互。
开放以太网 AI 训练加速
CMU 面向 400G RDMA 高性能网络,解决以太网训练中的多路径传输、乱序处理、拥塞控制与丢包重传等问题。
基于开放的 RoCEv2 以太网标准,为大规模 AI 训练提供高带宽、低延迟的数据传输能力。

超强网络传输
支持 GPU Direct RDMA、标准 RoCEv2、自研及开放 UEC 协议,有效解决数据丢包与拥塞问题。
高带宽低延迟
总带宽高达 2x200Gbps 甚至更高,转发速率达 250Mpps,大幅降低延迟,支持 AI 训练实时数据交互。
丰富功能集成
集成 OVS 等网络加速功能与多种 RDMA 技术,后续版本将加入 Adaptive routing 等功能。
灵活适配拓展
拥有 PCIe Gen5x16 等 Host 接口与 Virtio Net 设备类型,可与各类 AI 服务器及网络环境适配。
AI 推理加速
面向大模型与智能应用推理场景,优化 GPU 间高速数据传输与网络数据通路,降低推理延迟并提升并发处理效率。