超融合一体机正成为AI私有化部署的“主力军”。天风证券研报显示,华为昇腾一体机671B满血版可达到191 Token/s的吞吐和1192路并发,多个昇腾合作伙伴已上线DeepSeek超融合一体机。深信服AICP算力平台在多实例并发推理场景中可实现5-10倍性能提升。国产算力长期受益于DeepSeek开源生态,打破了闭源模型和闭源芯片建立的生态壁垒。
昇腾一体机全面适配DeepSeek,671B满血版1192路并发
华为昇腾已完成对DeepSeek系列模型的全面适配。昇腾社区正式上线DeepSeek-R1、DeepSeek-V3、DeepSeek-V2、Janus-Pro等系列新模型,支持昇腾硬件平台上开源即用、推理快速部署。
从推荐配置看,671B满血版(DeepSeek V3/R1)需Atlas 800 1A2(1024GB显存),系统吞吐可达191 Token/s,支持1192路并发。70B蒸馏版(DeepSeek-R1-Distill-Llama-70B)需Atlas 800 1A2(512GB),吞吐3300 Token/s,支持165路并发。32B/14B/7B/1.5B可使用Atlas 300V系列轻量级配置,进一步降低部署门槛。
多个昇腾合作伙伴已上线DeepSeek超融合一体机。超融合一体机集成了计算、存储、网络和管理功能,部署简单、管理方便且性能高效。对于金融、医疗等数据敏感行业,超融合一体机提供更加安全、可靠、高效的本地部署方案,真正实现开箱即用。
昇腾一体机DeepSeek模型推荐配置| 模型 | 参数 | 产品配置 | 吞吐(Token/s) | 并发(路) |
|---|
| DeepSeek V3 | 671B | Atlas 800 1A2 1024GB | 191 | 1192 |
| DeepSeek R1 | 671B | Atlas 800 1A2 1024GB | 191 | 1192 |
| Distill-Llama-70B | 70B | Atlas 800 1A2 512GB | 3300 | 165 |
| Distill-Qwen-32B | 32B | Atlas 800 1A2 256GB | 4940 | 247 |
深信服AICP平台实现5-10倍性能提升,统一管理成关键
随着私有云AI集群规模扩大,如何高效分配和管理GPU资源成为核心挑战。深信服AICP算力平台提供异构GPU算力管理调度、模型和数据管理等能力,最终交付形式为统一的AI算力管理平台。
AICP在多实例、并发推理场景中可实现5-10倍的性能提升。在32B模型2k上下文测试中,AICP并发是开源方案Ollama的8-10倍,总吞吐10倍以上(4×4090);在知识库应用场景(4k上下文)中,AICP并发是Ollama的2倍,总吞吐4-8倍。大模型并发度更高、吞吐量更大、推理响应延时更低,让企业级AI应用构建及实际使用时资源投入更低、体验更优。
vGPU技术是提升集群效率的关键。vGPU通过将物理GPU资源虚拟化为多个逻辑GPU资源,使多个应用共享同一物理GPU,提高资源利用率、降低硬件成本。以京东云一体机为例,使用vGPU资源利用率提升70%,推理效率提升30%。
统一纳管平台解决了大规模GPU集群的调度难题,使企业能够高效利用算力资源。深信服通过AICP平台的部署方案,让用户在企业级AI应用构建及实际使用时,资源投入更低、体验更优。
国产算力深度受益,打破闭源生态壁垒
国产算力长期受益于DeepSeek的开源生态。目前华为昇腾、寒武纪、海光信息、沐曦、天数智芯、摩尔线程等多家国产AI芯片企业宣布完成对DeepSeek模型的适配或服务上架,覆盖从训练到推理的全链条场景。
DeepSeek的开源生态打破了闭源模型(如OpenAI)和闭源芯片(如NVIDIA)建立的生态壁垒。开源模型+国产芯片的组合为国内AI产业提供了自主可控的替代路径,国产算力有望在这一过程中实现“量价齐升”。
短期看,若后续NV卡供不应求(受出口管制等因素影响),国产算力有望承接溢出需求。国产推理卡厂商(昇腾、寒武纪、海光信息、燧原科技、摩尔线程、天数智芯等)将迎来历史性机遇。建议关注国产算力AI芯片四小龙:寒武纪、海光信息、中科曙光、云天励飞。