AI文生视频技术正以前所未有的速度驱动影视行业变革。招商证券研究报告指出,从OpenAI的Sora到字节跳动的豆包视频生成模型,从MiniMax的海螺AI到CCTV-1的《千秋诗颂》,AI在文本创作、图像处理及视频生成等视听媒介中的应用正悄然重塑影视创作与制作流程,为内容生产带来效率革命和创意突破。
OpenAI Sora开启文生视频新纪元
2024年2月15日,OpenAI正式推出Sora,这款能根据文字指令即时生成短视频的模型,标志着AI在视频生成技术领域的巨大飞跃。Sora的亮点功能包括:文本到视频的转换(复杂图像生成和视频编辑技术在短时间内完成);多角色和复杂背景生成(通过文本指定场景中的元素,生成连贯且富有故事性的视频内容);物理模拟(尝试模拟现实世界的物理规则,如食物被咬时留下痕迹、柔软物体挤压时形变);视频编辑和扩展(对现有视频进行编辑、填补缺失帧或增加新内容);适应性强(处理不同持续时间、分辨率和宽高比的视频和图像)。
在Sora生成的17秒电影预告片《太空人的冒险故事》里,太空人、太空舱、盐渍沙漠等场景完全由AI创造,超越了物理限制(空间、时间及道具的局限)。文生视频AI不仅能生成虚拟人物替代真人演员,还能重现已消失或尚未存在的物品与场景,极大拓宽了影视内容创作的边界。
图表:Sora生成视频内容
表2:主流AI文生视频模型对比| 模型/平台 | 发布时间 | 核心能力 | 应用场景 |
|---|
| OpenAI Sora | 2024年2月 | 文字指令即时生成短视频、物理模拟 | 电影预告片、创意内容生成 |
| 海螺AI(MiniMax) | 2024年8月 | 电影感镜头移动、情绪表达生动、动作生成领先 | 视频创作、内容制作 |
| 豆包视频生成模型 | 2024年9月 | 多镜头一致性、多动作多主体交互、高保真 | 动画教育、影视制作 |
海螺AI+豆包:国产AI视频模型快速崛起
2024年8月底,MiniMax推出文生视频模型abab-video-1并应用于海螺AI。画质最高支持1280720的25fps,“拥有电影感镜头移动”,支持带文字元素,目前视频时长最高支持6秒。海螺AI在情绪表达方面表现出色——根据新加坡电影导演生成的女性面部特写视频,表情从快乐到悲伤、最后捂脸哭泣,情绪变化演绎非常生动。在人体动作流畅性和逼真性方面,海螺AI明显领先于Runway、可灵等竞品,画面主体几乎不发生剧烈形变或崩坏,颜色更为艳丽。
9月24日,字节跳动在火山引擎AI创新巡展发布豆包·视频生成模型(包括PixelDance图生视频及Seaweed文生视频模型),实现四方面突破:精准的语义理解及多动作多主体交互(解锁时序性多拍动作指令与多个主体间的交互能力);强大动态与酷炫运镜(变焦、环绕、平摇、缩放、目标跟随等多镜头语言);一致性多镜头生成(10秒讲一个完整故事,攻克多镜头切换时一致性的技术挑战);高保真高美感、多风格多比例。背后是字节在高效的DiT融合计算单元、全新扩散模型训练方法、深度优化Transformer结构等方面的技术投入。
AI赋能影视制作全流程,降本增效空间巨大
相较于传统方式,AI文生视频在影视制作的整个流程中展现出显著优势。在素材准备阶段,AI自动生成与剧本或导演意图相契合的素材内容,智能推荐相关素材,紧跟网络热点提供创作灵感。在素材处理与剪辑阶段,创作者可自定义视频纵横比、风格、滤镜及镜头运动轨迹等参数,AI平台集成音频、文字编辑等功能,实现一站式多模态内容创作。在成片修改与优化环节,通过局部动画笔刷等工具轻松实现对视频特定区域的精准修改。
《千秋诗颂》作为CCTV-1与人教社联合推出的创新之作,将小学语文课本中的经典诗词以动画故事形式重新演绎,开创了中国文生视频AI系列动画片的先河。AI提供初步视觉素材(人物造型、场景布局),创作者进行细部深描和个性化加工,如《春夜喜雨》中杜甫形象先由AI采集演员服饰及相貌数据转化为动画形象,再由后期团队雕琢面容、神态等细节。这种深度共创模式充分发挥了AI在效率上的优势,也彰显了人类智慧的审美情趣和创意表达能力,有望推动影视行业向更加智能化、高效化的方向发展。