国盛证券报告指出,Innodata等数据工程公司的强势表现揭示了一个被低估的AI投资方向。11月TheInformation报道OpenAI因高质量文本数据短缺在下一代Orion开发中遇阻,数据工程和算力一样,在AI时代扮演“卖铲子”角色。Innodata Q3营收同比增长136%,客户已覆盖七大科技巨头中的五家,数据工程的战略价值正被市场重估。
数据工程——AI产业链的“卖铲子”生意
Innodata是一家领先的数据工程公司,为AI建设者和采用者提供监督微调、RLHF(基于人类反馈的强化学习)、数据收集与创建、模型评估等全链条数据服务。在生成式AI的产业链中,数据工程与算力基础设施并列——如果说GPU是AI的算力引擎,高质量数据就是AI的知识燃料。大模型的训练和微调依赖于海量、高质量、多样化的标注数据,且随着模型规模的扩大和Scaling Law的持续演进,对数据的数量和质量要求不断提升。数据工程企业不直接参与大模型的训练或应用开发,而是为AI产业链提供基础性的数据支撑服务,这种“卖铲子”模式意味着无论最终哪个大模型胜出,数据工程需求都将持续增长。
Innodata业绩验证——客户质量与收入共振
11月8日Innodata发布2024Q3财报,营收5220万美元同比增长136%,净利润1740万美元(去年同期仅40万美元)。公司首席执行官表示全球最大的科技公司对生成式AI和大型语言模型的持续投资将继续成为Innodata的增长催化剂。公司大型科技客户名单已包括七大巨头中的五家,Q3新赢得了著名的社交媒体公司客户,客户结构的持续升级验证了数据工程服务的不可替代性。从盈利能力看,公司净利率从去年同期不足1%大幅提升至33%以上,反映数据工程服务在AI需求爆发背景下的定价能力和规模效应——固定成本一定比例的情况下,收入高增长直接转化为利润的高弹性释放。
OpenAI数据短缺事件——产业拐点的确认信号
2024年11月,TheInformation报道OpenAI在开发下一代Orion模型过程中遇到了高质量文本数据短缺的关键瓶颈,影响了模型性能的持续提升。根据Scaling Law理论,模型的表现应随着数据和计算能力的增加而提升,但当前高质量数据的稀缺性正在挑战这一理论的可持续性。OpenAI已组建专门团队由前预训练负责人Nick Ryder领导,研究数据不足的解决方案及Scaling Law的长远适用性。这一产业事件对数据工程行业的启示在于:AI产业正在从“有数据就能训”向“有好数据才能训”的阶段过渡,数据工程不再只是辅助性服务,而是决定AI模型能力上限的关键要素。Innodata等数据工程企业在数据采集、清洗、标注、合成和评估等全链条的能力储备,将在AI产业持续发展中获得持续的需求支撑。
表格:
Innodata数据工程服务能力与AI产业链定位| 服务类型 | 具体内容 | 适用场景 | 客户价值 |
|---|
| 监督微调 | 基于标注数据微调模型 | 垂直领域模型优化 | 提升模型特定任务准确率 |
| RLHF | 基于人类反馈的强化学习 | 模型对齐与安全 | 使模型输出符合人类偏好 |
| 数据收集与创建 | 多类型数据采集与生成 | 预训练与微调数据补充 | 解决数据短缺瓶颈 |
| 模型评估 | 性能测试与基准建立 | 模型上线前验证 | 确保模型质量与安全性 |