中国移动云智算技术白皮书围绕AI IaaS、AI PaaS、MaaS、AI SaaS四层架构,形成了十大关键技术方向:计算技术(算力芯片、智算超节点、算力原生)、存储技术(智算文件存储、训推多级缓存)、网络技术(卡间互联OISA、机间互联GSE)、算网一体技术(算力路由、在网计算)、AI开发平台技术(数据处理、训练框架、推理框架、智能体生成、AI开发工具)、模型服务、算网大脑、安全可信、绿色节能、未来技术展望。这十大方向覆盖了从底层硬件到上层应用、从单点技术突破到系统协同优化的完整技术栈。
计算技术——算力芯片、智算超节点与算力原生
算力芯片方面,中国移动推出大云磐石DPU,研发智算RDMA技术提升带宽,搭载轻量化RTT based拥塞流控算法降低时延,通过端侧多路径优化RDMA传输机制。智算超节点方面,64卡互联规模、800GB/s点对点带宽、微秒级时延,设计16/32/64卡多种规格,可满足大规模并行训练和私有化训推一体等不同场景。算力原生方面,COCA算力原生平台和“芯合”计划已实现7家智算芯片一体接入,服务“分钟级”上线,中远期探索虚拟指令集深度算力抽象技术。
存储与网络技术——从文件存储到全栈互联
存储技术方面,基于RDMA/Infiniband和DPU/NVMe SSD构建软硬融合极简化智算文件存储系统,以文件存储为中心实现与对象存储、缓存系统全面打通。训推多级缓存支持GPU数据卸载,构建GPU显存、主存、宿主机、网络持久化存储的多级缓存架构,利用CXL高性能互联技术支持多机互联。
网络技术方面,卡间互联OISA为大规模集群提供百纳秒级时延与无损传输能力,2025年中关村论坛展示64卡“国芯国连”超节点;机间互联GSE发布全套技术标准、千卡级商用交换机和业界首颗GSE网卡芯片“智算珠光”,满足超十万卡GPU集群组网需求。
算网一体与AI开发平台——深度融合与全链路赋能
算网一体技术包括算力路由(CATS工作组已完成需求/场景/架构/算力度量立项,全球首台算力路由器发布)和在网计算(将集合通信算子卸载至网络节点,压缩流量、缩短路径)。AI开发平台技术涵盖数据处理(数据合成+多模态整合+智能标注)、训练框架(并行优化目标MFU>50%、FP8低精度训练、故障容错千亿级参数5分钟恢复、异构混训加速比>95%)、推理框架(延迟降低30%、动态路由网关延迟降低20%-30%)、智能体生成(RAG+自主规划)、AI开发工具(向量数据库+多模数据库+低代码模型开发)。
模型服务、算网大脑、安全可信与绿色节能——运营与治理
模型服务方面,MaaS平台汇聚多层次模型体系,中国移动已构建DICT库和MaaS云市场,引入百余家厂商模型及智能体服务,通过动态路由将简单任务调度至小模型、复杂任务调度至大模型。算网大脑构建资源/任务/智能体三级编排调度体系,面向数据处理、推理、训练三类场景实现弹性伸缩、负载均衡和分时调度。安全可信向计算环境可信、数据安全可用、智算服务可靠演进,通过TPM/TCM、数据水印、数字签名+区块链等技术保障。绿色节能涵盖能效管理、液冷解耦、算电协同和余热回收四大方向。