返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

AI多模态能力突破

在OpenAI 12天直播发布会的第六天,ChatGPT视频通话功能正式亮相——用户可以通过实时视频与AI对话,ChatGPT不仅能听懂用户的语音指令,还能“看见”用户所处的环境并做出恰当回应。第三天,经过10个月优化的Sora Turbo视频生成应用同步发布。财通证券在AI行业研究报告中指出,多模态能力正从“锦上添花”演变为AI Agent实现复杂功能的驱动引擎,是技术迭代与应用场景纵深推进的关键桥梁。

多模态——从单点突破到系统协同

生成式AI作为多场景互动工具,能够理解并生成文字、图像、音频和视频等多种数据形式的多模态内容至关重要。2024年5月GPT-4o的发布标志着OpenAI在多模态领域迈出关键一步,而12月的发布会则展示了多模态能力在多个产品维度的系统化落地。

此次发布会的多模态产品分布在多个直播日中:Day 3的Sora视频生成、Day 5的ChatGPT与苹果系统集成(涉及视觉交互)、Day 6的视频通话与语音对话、Day 10的电话功能延伸。多模态能力不再是一个孤立的技术指标,而是嵌入到AI Agent从感知到执行的完整链路中。

财通证券认为,多模态能力为AI Agent实现更智能、更复杂的功能提供了基础支持,帮助AI Agent更好地理解环境,并结合图像、视频、音频、上下文等分析用户行为。多模态能力不仅是AI Agent的驱动引擎,也是推动技术与应用协同发展的关键因素。

Sora Turbo——视频生成的GPT-1时刻

Sora最早于2024年2月首次亮相,惊艳业界但仅限小范围测试。经过10个月的优化,Sora Turbo在12月发布会第三天的正式亮相,标志着视频生成模型向产品化迈出了实质性一步。

当前版本的Sora Turbo能够生成最长20秒的视频,并已实现视频编辑功能。具体而言,Sora不仅可以基于静态图片和现有视频创建新内容,还可以根据用户对视频不同时间点的具体描述来生成内容,从而更精确地指导视频片段的生成。这种“时间轴控制”能力使得视频生成从随机抽卡走向可控创作。

然而,Sora Turbo的局限同样清晰:该模型仍会出现动作不自然、生成不符合现实规律的现象,对物体运动的物理原理的理解仍需进一步提升。财通证券将Sora Turbo定位为“视频生成领域的GPT-1时刻”——产品初步可用、方向已明确,但距离完美仍有距离,未来迭代空间广阔。

实时视频通话——多模态交互的质变

在发布会第六天,ChatGPT视频通话功能亮相。该功能允许用户通过视频通话与ChatGPT实时互动,ChatGPT可以根据与用户的对话及观察用户所处的环境做出合适的回应。

这一功能的意义超越了传统的语音对话或图像识别。语音对话仅涉及音频模态,图像识别是静态的单次输入,而视频通话涉及实时流式视频、音频与环境上下文的综合理解,需要模型在低延迟下完成视觉识别、语义理解和语音生成的多重任务协同。

例如,用户可以通过摄像头展示家中的植物,询问ChatGPT如何养护;或者在旅行中展示标志性建筑,让ChatGPT讲解历史背景。这种交互方式将AI从“问答工具”升级为“实时助手”,进一步突破了传统的人机交互边界。

财通证券认为,视频通话功能拓展了AI模型可触达的用户并丰富了AI的可使用场景,将多模态互动范围从静态图像识别扩展到动态视频理解,是AI Agent实现场景化纵深推进的重要里程碑。

多模态能力支撑的AI应用场景拓展

表:OpenAI多模态产品矩阵与应用场景
产品/功能模态类型核心能力目标应用场景
Sora Turbo视频生成20秒视频生成、图片/视频编辑、时间轴控制内容创作、广告营销、影视预制作
视频通话实时视频+语音环境理解、实时回应、多模态协同远程协助、生活助手、教育辅导
高级语音对话音频自然语言对话、多语言支持、圣诞老人模式日常交流、语言学习、娱乐互动
ChatGPT集成苹果智能系统级多模态跨应用操作、Siri调用ChatGPT系统级AI助手、多任务处理
点击阅读报告原文: 财通证券:OpenAI12天直播带来的几点产业思考(18页)
相关报告