云智算技术白皮书(附行业趋势、转型格局与市场空间)
2026-08-01 06:54:20
1
云计算二十年演进经历了资源云化、云原生化、算力泛在化三个阶段,如今在AI大模型驱动下迈入智能化新阶段——云智算。中国移动这份白皮书提出了从IaaS/PaaS/SaaS三层向AI IaaS、AI PaaS、MaaS、AI SaaS四层拓展的体系架构,并系统阐述了计算、存储、网络、算网一体、AI开发平台、模型服务、算网大脑、安全可信、绿色节能、未来技术展望十大关键技术方向。从国产算力芯片、智算超节点、算力原生的自主可控攻关,到全向智感互联OISA、全调度以太网GSE的原创技术突破,再到算力路由、在网计算、异构混训的算网融合创新,白皮书勾勒了一条从基础设施到运营服务的全栈云智算升级路径。
一、从云计算到云智算——四层架构的范式转移
1.1 云计算的三阶段演进与云智算的内涵
云计算经过二十年发展,经历了资源云化(2006年)、云原生化(2013年)、算力泛在化(2020年)三个阶段,凭借虚拟化、云原生等技术实现了资源池化和弹性扩展能力。但随着千亿参数大模型等AI技术的迅猛发展,传统云服务体系面临严峻挑战:十万卡级超大规模GPU集群的异构算力需求已远超现有资源池化的调度能力;AI训练中TB级参数同步对时延极为敏感,传统网络架构难以满足低时延、高吞吐的传输要求;单一的IaaS/PaaS服务无法全面覆盖数据处理、模型训练、推理部署等AI开发全链路的需求。
云智算正是应对这些挑战的下一代云计算范式。其内涵是通过算网基础设施与人工智能核心技术深度融合,提供一体化算网资源、全栈式开发环境、一站式模型服务、多样化场景应用的新型云服务模式,是未来算网智一体化算力网络的核心载体。

1.2 四层架构的拓展逻辑
云智算体系架构从IaaS、PaaS、SaaS三层拓展为AI IaaS、AI PaaS、MaaS、AI SaaS四层。AI IaaS是算网一体化供给的基础设施服务,通过泛在网络推动东中西、云边端、通智超量、训练推理等多类型算力“联算成网”,依托算网统一编排的算网大脑,实现算力的灵活调度、即取即用。AI PaaS是面向各类AI开发者的工具平台服务,提供覆盖AI研发、运营、测试等全环节的工具链和开发环境。MaaS是加速AI一站式落地的模型服务,汇聚模型、能力、智能体等资源。AI SaaS是覆盖多样化场景的AI应用服务,赋能生产方式、生活方式、社会治理方式的数智化转型。围绕这四层,中国移动形成了十大关键技术方向。
二、计算技术——从算力芯片到智算超节点的自主突围
2.1 大云磐石DPU与国产算力芯片攻关
大模型训练和推理对算力芯片提出了超高带宽互联、极低时延等要求。中国移动以测促研推动国产化GPU成熟,同时布局DPU芯片,推出大云磐石DPU,提带宽、降延迟、优传输。带宽方面研发智算RDMA技术,大幅提升网络带宽;延迟方面搭载轻量化RTT based拥塞流控算法;传输方面通过端侧多路径、数据高速采集技术优化RDMA传输机制,解决多路径hash冲突问题。面向近期,升级DPU芯片智算网络带宽,联合国产网侧厂商形成端网协同解决方案;面向中远期,基于SIMT架构与RISC-V指令集打造AI智算开放新生态。

2.2 智算超节点——64卡互联与国产化突破
2024年英伟达NVL72超节点支持单机内72个GPU高速互联,进一步拉大中美算力技术代差。中国移动基于原创COCA异构计算架构,联合国产全产业链伙伴打造大云磐石超节点,以统一开放互联的自主协议为基础,构建64卡互联规模、800GB/s点对点带宽、微秒级时延的超节点。一是以开放式硬件架构为核心构建跨GPU厂商互通兼容的技术体系;二是融合COCA智算软件栈实现算力应用一体加速;三是设计16/32/64卡多种产品规格实现算力灵活配置。面向近期聚焦超节点生态构建和应用示范,推进行业形成跨GPU厂商兼容的互联标准;面向中远期以更高规模、更大带宽、更低时延为构建目标,驱动国产核心器件协同创新。
2.3 算力原生——“芯合”计划实现7家芯片一体接入
当前国内智算芯片生态碎片化,上层模型和应用向国产体系迁移难、意愿低。中国移动发布业内首部《面向智算的算力原生白皮书》,推动统一算力抽象、编程模型及虚拟指令集等系列标准及开源工作组建设,推出COCA算力原生平台,发布“芯合”计划,已实现7家智算芯片的一体接入,服务“分钟级”上线。面向近期深化研究AI芯片统一算力抽象机制及转换方法,接入更多AI芯片,支撑跨厂商低成本迁移;面向中远期以“异构CPU+智算AI芯片”一体融通为目标,探索虚拟指令集等深度算力抽象技术,形成即插即用的统一XPU算力底座。

三、存储与网络——从文件存储到全栈智能互联
3.1 智算文件存储与训推多级缓存
基于通算理念构建的存储系统无法满足智算应用对数据访存性能、数据流转效率的新需求。中国移动提出基于高性能网络技术栈(RDMA、Infiniband)和高性能硬件(DPU、NVMe SSD)构建的软硬融合极简化存储系统,以文件存储为中心实现与对象存储、缓存系统的全面打通。训推多级缓存方案支持GPU数据卸载,构建包括GPU显存、主存、宿主机与网络持久化存储的多级缓存架构,利用CXL高性能互联技术支持多机互联和资源共享,依托DPU轻计算客户端卸载技术构建计算与存储间的高带宽通道。
3.2 全向智感互联OISA——卡间互联的国产方案
传统GPU互联技术在数据传输效率、可靠性和互联规模上遇瓶颈。中国移动提出全向智感互联OISA协议,通过全向连接拓扑架构构建支持大规模GPU卡级互联的通信体系,包含统一报文格式设计、多语义融合、多层次流控与重传机制。协议在数据层采用智能流量感知标签技术支持链路状态实时监测,物理层支持轻量级纠错能力,为大规模集群提供百纳秒级时延与无损传输能力。2025年中关村论坛展示的64卡“国芯国连”超节点AI算力集群标志着自主可控的技术革新。面向近期加速推进OISA协议2.0标准化进程;面向中远期突破Chiplet异构集成技术,开展光电协同技术预研。

3.3 全调度以太网GSE——机间互联的中国方案
AI大模型以GPU集群分布式训练为基础,现有InfiniBand和RoCE技术均不满足未来机间互联演进需求。中国移动提出全调度以太网GSE技术架构,全面革新以太网底层转发机制和上层协议栈,发布全套GSE技术标准、全量支持GSE能力的千卡级商用交换机及业界首颗GSE网卡芯片“智算珠光”。面向近期布局GSE-N2N和GSE-E2E两大场景,攻关GSE交换芯片及网卡芯片,引入基于PKTC的多路径喷洒、基于DGSQ的拥塞避免、基于66B原子码块的故障检测与通告三大原创技术;面向中远期引入GSE通信库优化和光电路交换机,提升智算网络集群规模及算力水平。

四、算网一体与AI开发平台——从网络到训练的深度融合
4.1 算力路由与在网计算
算力路由支持归一化算网度量、自适应算力通告、多因子联合路由三大创新技术,将算力信息封装至路由协议,在传统网络路由的距离矢量上叠加算力向量。中国移动已在IETF推动成立算力路由CATS工作组,是路由域近20年由中国企业/高校推动成立的唯二工作组之一,已完成需求、场景、架构、算力度量立项,2024年MWC发布全球首台算力路由器,已构建5省20地市规模中试网络。在网计算可以将Allreduce、Broadcast等集合通信算子卸载至网络节点,或在中间网络节点缓存K-V cache,在网络内完成数据处理动作,压缩网络流量、缩短传输路径。

4.2 训练框架——并行优化、低精度训练与异构混训
训练并行优化通过建立自动搜索系统实现不同节点规模的最优参数组合,目标在超万卡集群中实现MFU超50%,中远期突破60%。低精度训练完善FP8混合精度训练框架,构建梯度异常检测与自动修复机制,中远期探索FP4/INT4超低精度计算架构。故障容错通过硬件热备保障单点故障算力损失≤5%,研发秒级轻量化检查点达成千亿级参数5分钟内全量恢复,中远期构建AI驱动的故障预测模型实现“未降先防”。
异构混训是中国移动自主研发的核心技术,已实现百亿参数大模型混训加速比达95%以上。“芯合”异构混训系统通过非均匀拆分计算任务、拉通异构芯片间集合通信机制,实现跨厂商、跨代际、跨架构多类型智算芯片的分布式训练。面向近期实现异构流水线并行、异构数据并行等非均匀并行技术,支持CPU绕转和GPU直接通信两种跨机通信模式;面向中远期实现最优并行策略推荐,构建异构统一集合通信标准。

4.3 推理框架与智能体生成
推理并行效能优化通过预填充与解码阶段解耦的运行时架构、动态批尺寸调整与显存分区管理技术,将高并发场景下延迟压降30%以上;面向中远期研发基于强化学习的自适应并行引擎。推理网关优化基于KV Cache状态、系统负载、硬件拓扑等多维度指标融合分析构建自适应路由策略,实现端到端推理延迟降低20%-30%,资源利用率提升至85%以上。
RAG技术面向近期优化检索参数和重排序过程,面向中远期加强知识库自动管理和更新机制,引入自主Agent实现动态决策。自主规划面向近期引入低代码编排模式和MCP协议标准化整合,建立反思机制;面向中远期通过蒙特卡洛树搜索实现自适应决策优化。

五、模型服务、算网大脑与安全可信——运营与治理的全面升级
5.1 模型汇聚与智能体融合
MaaS平台汇聚九天系列大模型和主流模型,构建覆盖“L0、L1、L2”的多层次模型体系。中国移动已构建DICT库、MaaS云市场等多种成熟商业模式,引入百余家厂商模型及智能体服务。模型智能体融合通过分层融合和动态路由技术,自动将简单任务调度至小参数量模型、复杂任务调度至大参数量模型,实现客户效益最大化。面向中远期设计分布式信用分配体系,通过Shapley值量化各模型贡献度,优化资源调度策略。

5.2 算网大脑——资源、任务、智能体三级编排
算网大脑构建多集群资源统一抽象层,通过算力度量量化异构算力、存储容量及网络状态,形成全局资源动态画像和多目标动态调度策略。任务式编排调度面向数据处理、分布式推理与集中式训练三类核心业务范式,通过弹性层级队列、负载感知调度、重调度保障多租户数据处理任务稳定性;推理场景基于全局流量负载均衡和自适应弹性伸缩;训练场景通过分时调度实现训推混合负载、白天推理晚上训练,有效降低总体成本。智能体编排调度基于分布式AI Agent协同架构,整合ANP与MCP协议,通过智能体路由实现多智能体动态协作与资源高效管控。

5.3 安全可信与绿色节能
安全可信向计算环境可信、数据安全可用、智算服务可靠三个方向演进。计算环境可信通过智能检测监测技术和可信计算技术(TPM/TCM)构建底层信任根;数据安全可用覆盖数据全生命周期防护、基于特征分析的投毒数据检测、基于数据水印的追踪技术;智算服务可靠通过AI+模型安全检测、模型偏离监测、模型与结果签名链技术保障。
绿色节能方面,中国移动提出能效、碳效、算效评价模型,建立“业务运行-算力输出”模型实现精准管理。液冷技术突破高密换热、高精度插接等核心技术,推进液冷基础设施侧与服务器侧解耦;空调智慧化运维通过AI驱动从“经验运维”向“AI智控”升级。算电协同构建“信息流-能量流”双向耦合机制,余热回收将低品位废热提升品位满足建筑、工业、农业用热需求。
