云计算二十年演进经历了资源云化、云原生化、算力泛在化三个阶段,如今在AI大模型驱动下迈入智能化新阶段——云智算。中国移动这份白皮书提出了从IaaS/PaaS/SaaS三层向AI IaaS、AI PaaS、MaaS、AI SaaS四层拓展的体系架构,并系统阐述了计算、存储、网络、算网一体、AI开发平台、模型服务、算网大脑、安全可信、绿色节能、未来技术展望十大关键技术方向。从64卡互联智算超节点到全向智感互联OISA、全调度以太网GSE,再到算力原生“芯合”计划实现7家芯片一体接入,这份白皮书勾勒了一条从基础设施到运营服务的全栈云智算升级路径。
云智算的内涵与四层体系架构
云智算是通过算网基础设施与人工智能核心技术深度融合,提供一体化算网资源、全栈式开发环境、一站式模型服务、多样化场景应用的新型云服务模式。云计算向云智算的升级体现在体系架构从IaaS、PaaS、SaaS三层拓展为AI IaaS、AI PaaS、MaaS、AI SaaS四层。
AI IaaS是算网一体化供给的基础设施服务,通过泛在网络推动东中西、云边端、通智超量、训练推理等多类型算力“联算成网”,依托算网统一编排的算网大脑实现算力的灵活调度。AI PaaS是面向各类AI开发者的工具平台服务,提供覆盖AI研发、运营、测试等全环节的工具链和开发环境。MaaS是加速AI一站式落地的模型服务,汇聚模型、能力、智能体等资源。AI SaaS是覆盖多样化场景的AI应用服务,赋能数智化转型。围绕这四层架构,中国移动形成了十大关键技术方向。
计算技术——算力芯片、智算超节点与算力原生
大模型训练和推理对算力芯片提出了超高带宽互联、极低时延等要求。中国移动推出大云磐石DPU,研发智算RDMA技术提升网络带宽,搭载轻量化RTT based拥塞流控算法降低时延。智算超节点方面,中国移动基于原创COCA异构计算架构,联合国产全产业链伙伴打造大云磐石超节点,以统一开放互联的自主协议为基础,构建64卡互联规模、800GB/s点对点带宽、微秒级时延的超节点。2025年中关村论坛展示的64卡“国芯国连”超节点AI算力集群标志着自主可控的技术革新。
算力原生方面,当前国内智算芯片生态碎片化,上层模型向国产体系迁移难。中国移动发布业内首部《面向智算的算力原生白皮书》,推动统一算力抽象、编程模型及虚拟指令集等系列标准,推出COCA算力原生平台,发布“芯合”计划,已实现7家智算芯片的一体接入,服务“分钟级”上线。面向中远期以“异构CPU+智算AI芯片”一体融通为目标,探索虚拟指令集等深度算力抽象技术。
网络技术——OISA卡间互联与GSE机间互联
中国移动构建“卡间-机间”全栈智能互联技术体系。卡间互联方面,全向智感互联OISA协议通过全向连接拓扑架构构建支持大规模GPU卡级互联的通信体系,包含统一报文格式设计、多语义融合、多层次流控与重传机制,为大规模集群提供百纳秒级时延与无损传输能力。2024年以来,中国移动在多样性算力峰会成立“OISA协同创新平台”,在中国算力大会发布“OISA Gen1.1”协议,成立“超节点算力集群创新联合体”。
机间互联方面,全调度以太网GSE技术架构全面革新以太网底层转发机制和上层协议栈,发布全套GSE技术标准、全量支持GSE能力的千卡级商用交换机及业界首颗GSE网卡芯片“智算珠光”。GSE引入基于PKTC的多路径喷洒、基于DGSQ的拥塞避免、基于66B原子码块的故障检测与通告三大原创技术,满足超十万卡GPU集群组网需求。
算网一体与AI开发平台——算力路由、在网计算与异构混训
算力路由支持归一化算网度量、自适应算力通告、多因子联合路由三大创新技术,将算力信息封装至路由协议,在传统网络路由的距离矢量上叠加算力向量。中国移动已在IETF推动成立算力路由CATS工作组,是路由域近20年由中国企业/高校推动成立的唯二工作组之一,2024年MWC发布全球首台算力路由器。在网计算可以将Allreduce、Broadcast等集合通信算子卸载至网络节点,压缩网络流量、缩短传输路径。
AI开发平台方面,中国移动自主研发“芯合”异构混训系统,百亿参数大模型混训加速比达95%以上。通过非均匀拆分计算任务、拉通异构芯片间集合通信机制,实现跨厂商、跨代际、跨架构多类型智算芯片的分布式训练。训练并行优化目标在超万卡集群中实现MFU超50%,中远期突破60%。故障容错通过硬件热备保障单点故障算力损失≤5%,研发秒级轻量化检查点达成千亿级参数5分钟内全量恢复。
算网大脑与安全可信——三级编排与全栈安全
算网大脑构建多集群资源统一抽象层,通过算力度量量化异构算力、存储容量及网络状态,形成全局资源动态画像和多目标动态调度策略。任务式编排调度面向数据处理、分布式推理与集中式训练三类核心业务范式,通过弹性层级队列、负载感知调度、重调度保障多租户任务稳定性;推理场景通过自适应弹性伸缩提升全局Token吞吐;训练场景通过分时调度实现训推混合负载。智能体编排调度基于分布式AI Agent协同架构,整合ANP与MCP协议,通过智能体路由实现多智能体动态协作。
安全可信向计算环境可信、数据安全可用、智算服务可靠三个方向演进。计算环境可信通过智能检测监测技术和可信计算技术(TPM/TCM)构建底层信任根;数据安全可用覆盖数据全生命周期防护、基于特征分析的投毒数据检测、基于数据水印的追踪技术;智算服务可靠通过AI+模型安全检测、模型偏离监测、模型与结果签名链技术保障。