返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

大模型数据价值链

同样的数据标注任务,通才标注入门只需几美元,而PhD级专家标注可达数百美元——价差数十倍。艺恩数据这份白皮书揭示了大模型数据市场的价值分布规律:从预训练语料到多模态数据,八层结构的价值层层递进。越靠近“专家级、多模态、可验证”的一端,单位价值越高、可复制性越低。核心判断是:合规授权与专家判断正在成为数据定价权的两大核心来源。

八层结构的价值递进

数据价值链从底层到顶层呈现清晰的价值递进。

①预训练语料(web/书籍/代码)是规模化基础,边际价值随枯竭下降。这是大模型训练的基础原料,但随着公开语料逼近枯竭,通用网络数据的价值正在持续走低。

②SFT指令微调数据对齐任务格式,塑造可用性。将预训练模型转化为可执行具体任务的工具,需要高质量的指令-响应对。

③RLHF/偏好数据对齐人类偏好,决定“好用”程度。这是OpenAI等头部实验室的核心竞争力——让模型说“人话”、符合人类价值观。

④RLAIF/AI反馈数据降低人工成本的规模化对齐。用AI替代人工进行偏好标注,大幅降低成本,但质量略逊于人类专家。

⑤专家/领域数据(PhD级)突破专业能力天花板,溢价最高的人工数据。在医疗、法律、编程等高壁垒领域,专家级标注数据是模型专业能力的天花板。

⑥评测/基准数据是能力度量与迭代方向的标尺。没有高质量的评测数据,就无法知道模型“好不好”、该往哪个方向改进。

⑦合成数据是缓解数据墙、增速最快的新供给。以模型生成数据反哺训练,NVIDIA已通过收购Gretel.ai将该赛道纳入战略版图。

⑧多模态数据(图像/视频/4D)最稀缺、溢价最高的层级。视频生成模型对“黄金数据”的渴求使其成为整个数据市场中最稀缺、单位价值最高的部分。

质量溢价——同一份标注价差可达数十倍

标注单价随专业度上升呈阶梯式增长,通才标注→专家标注可达数十倍价差。通用类标注任务每件仅需几美元,由众包工人完成;领域基础级任务(如医疗记录结构化)每件需几十美元,需要领域知识培训;专家级任务(如代码生成验证、法律文书分析)每件可达数百美元,需PhD级专业能力。这一价差意味着:数据市场的价值不在“数量”而在“质量”,不在“通用”而在“专业”。业界观察表明,模型性能提升中归因于数据质量(而非架构)的比例超过70%——“数据中心化AI”正在成为行业共识。

从“抓取”到“付费授权”的转型

当公开语料枯竭、版权诉讼频发,模型厂商转向授权协议。据Media & the Machine追踪,早期34笔交易总承诺约29.2亿美元(约8.16亿/年)。标志性交易包括:OpenAI与News Corp 5年最高2.5亿美元(出版史最大);Reddit与Google约6000万美元/年、与OpenAI约7000万美元/年;News Corp与Meta 3年1.5亿美元;Disney与OpenAI授权角色+入股10亿美元。

Reddit的数据资产价值重估尤为值得关注。截至2025年6月的三个月中,Reddit占全部AI引用3.11%,为Wikipedia(1.35%)的两倍多,成为AI模型第一大被引来源。这推动了数据定价模式从“固定费”向“使用量→动态定价”演进。

全球玩家卡位与三大梯队

价值前沿正从“规模化通用标注”向“专家×多模态”迁移,呈现三大梯队分布。价值高地(右上):Surge、Mercor、Scale、Turing、Toloka——以专家人工判断与多模态数据获取软件级溢价。平台/工具(中部):Labelbox、Snorkel——程序化标注与评测工具。传统众包(左下·承压):Appen、iMerit——通用单模态标注被自动化与合成数据挤压。

中国厂商正集中卡位多模态与垂直象限,与全球价值迁移方向一致。海天瑞声(语音/多模态)、澳鹏中国/曼孚科技(自动驾驶·标注)、艺恩(垂类视频数据)分别在不同赛道占据位置。四个范式样本揭示了行业方向:Scale AI(通用标注/RLHF)营收3年增长11倍;Surge AI/Mercor(专家/前沿数据)ARR分别达14亿和4.5亿美元;Reddit(内容授权)市值在18个月内增长至约390亿美元;智元AgiBot World(垂直/具身多模态)开源百万级真机片段,规模约为Google Open X-Embodiment的10倍。价值正从“规模化通用标注”流向“专家判断、独家授权与具身多模态”,谁掌握稀缺合规数据,谁就掌握定价权。
点击阅读报告原文: 艺恩:2026全球大模型数据市场白皮书(35页)
相关报告