返回顶部
返回首页 会员充值 我的足迹 返回上一页
跳转三个皮匠报告小程序
具身智能
情绪经济
商业航天
十五五
银发经济

NebiusToken优化

国信证券AI云深度报告重点分析了Nebius Token Factory的推理优化能力。2026年5月Nebius以约6.43亿美元收购Eigen AI,其AWO 4-bit量化(MLSys 2024最佳论文)和SpAtten稀疏注意力是核心技术。优化让单卡Token吞吐提升2-3倍,Token价格保持与原模型一致,同样的硬件成本能卖出更多收入。以GLM5.2部署在B200为例:原模型推理毛利率30%;叠加Nebius基础设施优化后升至54%;Eigen全开后单卡TPS从4432提升至10705 token/s,推理毛利率达81%。Token Factory通过ODM硬件、Eigen CUDA Kernel、推理调度三层垂直整合,将开源模型推理成本最高砍掉70%。

Eigen AI——推理优化层的核心拼图

2026年5月,Nebius以约6.43亿美元收购硅谷AI推理优化公司Eigen AI,三位出自MIT HAN Lab的联合创始人全部加入。Eigen AI拥有两项核心技术:AWO 4-bit量化(MLSys 2024最佳论文,4-bit模型生产部署的全球标准)和SpAtten稀疏注意力(2020年以来HPCA最高引论文)。收购前两家已联合优化DeepSeek、Llama、Qwen等模型,在Artificial Analysis基准上跑出911 tokens/秒的领先成绩。整合后Token Factory将覆盖GPT-OSS、Gemma、Llama、DeepSeek、GLM、Kimi等几乎所有主流开源模型。Nebius同时通过其他收购补齐能力:2026年2月拟全资收购Tavily,将实时网络搜索、事实验证能力接入AI云平台;2026年5月引入Clarifai核心团队并收购相关专利组合,强化系统级推理优化、资源调度及生产级部署能力。两项交易分别从智能体应用层与底层推理基础设施完善技术栈,推动Nebius由算力基础设施提供商向全栈AI云平台升级。

优化原理——自研CUDA Kernel+量化+剪枝

Eigen AI的优化通过多个技术层叠加实现。自研CUDA Kernel绕过VLLM通用调度层的overhead,实现算子融合,减少内存读取overhead(1.2x加速)。AWO 4-bit量化释放显存,有效Batch提升1.5倍,权重读取量理论上可压缩4倍。结构化剪枝通过去除10-15%冗余注意力头/FFN中间层路径,激活参数量减少约10%。以GLM5.2在B200上的测算为例:原模型单卡TPS 4432 token/s,收入8.62美元/小时,推理毛利率30%;Nebius基础设施优化(自研CUDA Kernel、4-bit量化、剪枝)后,单卡TPS提升至4432 token/s(实际优化后TPS大幅提升,此处为测算基准),收入9.91美元/小时,毛利率54%;Eigen全开后单卡TPS达10705 token/s(原模型的2.4倍),收入23.93美元/小时,毛利率81%。芯片租赁价格方面,Nebius通过使用定制ODM机箱节省10-15%OEM溢价,自研液冷方案将服务器功耗降低约20%,使B200租赁价格从6美元/小时降至4.55美元/小时。

垂直整合——三层叠加降本70%

Token Factory的70%降本不是某一层的优化结果,而是三层垂直整合的叠加效应。硬件层:自研ODM机箱节省10-15%OEM溢价,自研液冷降功耗20%。系统层:裸金属去Hypervisor消除20-25%虚拟化损耗,InfiniBand保障零丢包通信,K8s+SLURM双线编排回收5-15%闲置算力。模型层:Eigen的4-bit量化、稀疏注意力、结构化剪枝使单卡Token产出提升2-3倍,自研CUDA Kernel绕过通用调度层overhead。大厂云硬件团队和推理团队分属不同P&L,各自优化各自的目标。Nebius拥有“优化吞吐→更少GPU→赚更多收入”的激励,而AWS的销售KPI是卖GPU-hour,缺少动力帮客户进行优化。这种组织架构的差异导致大厂云能做功能对等的产品,但较难复制Token Factory的成本结构。

客户价值——单GPU收入提升,全链路成本下降

Token Factory的优化直接转化为客户价值。以Prosus部署Llama-3.3-70B模型为例:裸金属部署单卡TPS约2.1K,完成200B token/天需约1102张H100,按裸金属2.5美元/GPU-hr计算客户支出66,138美元/天;Token Factory单卡TPS约9.45K(4.5倍提升),仅需244张H100,按0.15美元/百万Token计算客户支出约23,400美元/天,Nebius单GPU日收入从60美元/天提升至96美元/天。对于客户来说,Token Factory的Token优化能力可有效降低AI推理部署的全链路成本。传统自部署路径下,客户需要用更多的卡完成同等每日Token量需求,并需承担GPU集群运维、推理内核调优的人力投入,以及10-20%的冗余缓冲算力闲置损耗。
GLM5.2部署在B200的推理毛利率演进
优化阶段单卡TPS收入(美元/h)推理毛利率
原模型4,4328.6230%
Nebius基础设施优化4,4329.9154%
Eigen全开10,70523.9381%
点击阅读报告原文: 人工智能行业专题(19):从Nebius看新兴云与开源模型Token优化-260724(36页)
相关报告