DeepSeek的“破圈”并非孤例——中国互联网大厂在大模型领域同样取得了可观的进展。光大证券《互联网大厂如何受益于DeepSeek-R1"破圈"?》报告显示,阿里Qwen2.5-Max在Arena-Hard、LiveBench等基准测试中超越DeepSeek-V3;腾讯混元Hunyuan-Large在MMLU、MATH超越Llama3.1-405B;快手可灵文生视频在AGI-Eval榜单排名全球第二,超越OpenAI Sora;哔哩哔哩Index-70B角色扮演模型在CharacterEval中均分第一。本文梳理阿里巴巴、腾讯、百度、快手、美团、哔哩哔哩六家互联网大厂的大模型最新进展。
阿里巴巴——Qwen2.5-Max比肩DeepSeek-V3,开源生态全球领先
阿里通义千问系列在2025年1月迎来里程碑式升级。Qwen2.5-Max作为超大规模MoE模型,使用超过20万亿token预训练数据,在指令模型对比中,Arena-Hard、LiveBench、LiveCodeBench、GPQA-Diamond等基准测试均超越DeepSeek-V3。基座模型对比中,MMLU、MATH、BBH等测试同样超越DeepSeek-V3。代码编写能力显著提升,一句话即可生成代码可视化及小游戏。实验性推理模型QwQ-32B-Preview在数学和编程领域已取得显著进步,尽管存在语言切换等局限,但DeepSeek-R1的开源技术有望成为其改进的借鉴。在开源生态方面,Qwen系列提供1.5B到110B全尺寸开源模型,全球最大AI开源社区Huggingface排名前十的开源大模型全部为基于Qwen二次训练的衍生模型。DeepSeek-R1本身也基于Qwen 2.5模型(1.5B到32B)蒸馏出多个小模型,进一步验证了Qwen在开源社区的核心地位。
腾讯——组织架构调整聚焦产品化,混元多模态全面布局
腾讯大模型的布局此前相对分散,涵盖混元大模型团队、腾讯AI Lab、腾讯云AI、微信AI等多个团队。2025年初,腾讯AI助手“元宝”完成组织调整,从TEG(技术工程事业群)调整至CSIG(云与智慧产业事业群),由腾讯会议负责人吴祖榕负责产品能力建设和体验优化。这一调整标志着腾讯AI战略从“技术驱动”向“产品体验驱动”转变,腾讯会议AI助手Pro等成功经验有望在元宝复现。基础模型方面,混元Hunyuan-Large(389B总参数,52B激活参数)在MMLU、MATH、HumanEval超越Llama3.1-405B及DeepSeek-V2.5。多模态布局方面,腾讯上线业界首个一站式3D内容AI创作平台——混元3D AI创作引擎,支持文本/图片一键生成高质量3D模型;混元视频生成大模型(130亿参数)已于2024年12月开源,在超写实画质、原生镜头切换等方面具备高质量。但元宝App 24M12 MAU仅211万,明显低于豆包(约7,116万),产品化推广将是25年重点方向。
互联网大厂大模型关键进展| 公司 | 最新模型 | 关键突破 | 核心优势 |
|---|
| 阿里巴巴 | Qwen2.5-Max | 超越DeepSeek-V3 | 开源生态全球第一 |
| 腾讯 | 混元Hunyuan-Large | 超越Llama3.1-405B | 3D/视频多模态布局 |
| 百度 | 文心4.0 Turbo | 期待25年新版本 | 全栈AI服务(百舸+千帆) |
| 快手 | 可灵1.6 | 文生视频全球第二 | 领先多模态视频生成 |
百度、快手、哔哩哔哩——各具特色的差异化路径
百度作为最早发布国产大模型的企业,文心大模型已迭代至4.0 Turbo,通过千帆(大模型精调与应用开发平台)和百舸(异构计算平台)为企业提供全栈服务解决方案。百舸平台支持同一智算集群混合使用不同厂商芯片,多芯混合训练7万卡性能损失控制在5%,已是业界最高水平。快手可灵作为全球首个可公开体验的真实影像级视频生成大模型,自24年6月发布以来已完成数十次迭代,1.6版本图生视频整体效果较1.5提升195%,在AGI-Eval文生视频榜单中以0.573分排名第二,超过OpenAI Sora(0.561分),仅略低于Pixverse-V3(0.5732分)。哔哩哔哩Index-70B角色扮演模型在中文角色扮演评测集CharacterEval中均分第一,7/12细分维度排名第一,符合B站娱乐、教育、视频创作的应用场景,模型已应用于AI字幕(支持近10种语言实时翻译,准确度接近90%)。美团联合推出MobileVLMV2,在移动设备等资源受限环境中展现优势,在高通骁龙888CPU上实现21.5 Token/秒的推理速度。