字节跳动正在构建从文本到图像、视频、语音、音乐的完整多模态AI能力矩阵。华泰证券深度研究指出,2024年9月豆包发布视频生成模型PixelDance与Seaweed(被称为中国版Sora),11月发布SeedEdit图生图功能,加上此前发布的Seed-Music音乐大模型、Seed-TTS语音模型,豆包已形成“文生文+文生图+图生图+文生视频+文生音乐+语音合成+声音复刻”的全方位多模态能力。字节已提升即梦AI优先级,认为多模态产品才是AI的未来形态。
视频生成——中国版Sora正式亮相
2024年9月24日,字节发布豆包视频生成模型——PixelDance模型与Seaweed模型,被称为“中国版Sora”。核心优势:精准语义理解(多主体、动作交互,解锁时序性多拍动作指令)、强大动态与酷炫运镜(变焦、环绕、平摇、缩放、目标跟随等多镜头话语能力)、一致性多镜头生成(一句提示词内实现多个镜头切换,保持主体、风格和氛围一致,10秒讲述完整故事)。技术底层:高效的DiT融合计算单元,更充分压缩编码视频与文本,全新设计的扩散模型训练方法。12月,豆包电脑版视频生成功能开启内测,支持上传图片+提示词+运镜/分镜信息生成视频。
图像生成——SeedEdit让AI“会P图”
2024年11月11日,豆包发布AI P图功能,由字节通用图像编辑模型SeedEdit提供技术支持。用户打开doubao.com选择“图片生成”后,选择“继续编辑”,输入一句简单指令即可实现一键P图。支持功能:局部修图、氛围优化、一键换装、风格转化。2024年12月5日,豆包进一步支持一键生成带有指定文字的图片(如表情包、微缩景观中的文字),用文字和画面激发更多创意表达。SeedEdit的技术路径是从图像再生成到图像编辑,实现了对生成内容的精细控制。
音乐生成——Seed-Music统一框架
2024年9月18日,豆包大模型团队正式发布自研音乐大模型Seed-Music,提供四项核心功能:可控音乐生成(多模态输入,生成3分钟全曲)、谱转曲(乐谱转音乐)、词曲编辑(精确局部改编)、零样本人声克隆。支持10种创作任务,满足音乐小白和专业音乐人的不同场景需求。技术框架:表征模型(压缩音频波形)→生成器(处理用户控制输入生成中间表示)→渲染器(合成高质量音频波形)。海绵音乐是豆包AI音乐的前端产品,相比Suno在中文歌曲效果上更好(吐字清晰度、演唱流畅性、曲风偏好更符合中国人的喜好)。
语音模型——Seed-TTS+Seed-ASR+同声传译
豆包在语音方向已形成完整技术栈。Seed-TTS(语音生成基座模型):生成与真人几乎无法区分的语音,支持语音属性定制(语言、情感、音色、情景),基于简单样本即可模仿声音特质和发音瑕疵,已应用到豆包产品线。Seed-ASR(语音识别模型):支持多语种、多口音识别,已在豆包APP英语会话、虚拟聊天伴侣、复刻亲友声音等场景落地。豆包同声传译模型(2024年9月发布):端到端架构,翻译高精准、高质量、低时延,支持音色克隆,媲美真人同传效果。字节的语音技术已形成“输入(ASR)+处理(大模型)+输出(TTS)”的完整闭环。
表:豆包多模态模型矩阵| 模态 | 模型/产品 | 发布时间 | 核心能力 |
|---|
| 文本 | 豆包通用模型Pro/Lite | 2024年5月 | 128K/256K上下文,MMLU-pro+25% |
| 视频 | PixelDance+Seaweed | 2024年9月 | 多镜头切换一致、运镜控制 |
| 图像 | SeedEdit | 2024年11月 | 文生图、图生图、AI P图 |
| 音乐 | Seed-Music | 2024年9月 | 可控音乐生成、谱转曲、人声克隆 |
| 语音 | Seed-TTS | 2024年6月 | 高自然度语音合成、音色克隆 |
| 语音识别 | Seed-ASR | 2024年7月 | 多语种识别、口音适应 |
| 同声传译 | 豆包同声传译 | 2024年9月 | 端到端实时翻译、音色克隆 |