返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

数据标注与RLHF市场

Scale AI年收入从8000万美元跃升至8.7亿美元仅用3年,Surge AI零融资自举至超10亿营收,Mercor管理3万专家日付150万美元——数据标注与RLHF市场正在经历从“劳动密集型外包”到“专家级数据服务”的质变。艺恩数据这份白皮书揭示了核心规律:越靠近“专家级、多模态、可验证”的一端,单位价值越高。通用标注正在被自动化挤压,而RLHF与专家数据正在成为价值高地。

市场的真实体量

常被引用的“AI训练数据集”狭义口径仅约28-32亿美元,严重低估了真实市场。真实支出多在标注、RLHF/专家数据服务中,而非打包数据集。Scale(约20亿)+Surge(约14亿)+Mercor(约7.6亿)2025年毛收入合计约42亿美元,已超过整个“训练数据集”的全球估值。本白皮书采用广义口径(数据集+采集标注+RLHF/专家数据+合成数据),自下而上测算2024年约60-90亿、2025年约100-160亿美元。

头部玩家格局与估值

美国前沿数据公司估值已达软件级。Scale AI在2025年6月获Meta 143亿美元投资,估值达290亿美元,年营收从2021年的8000万跃升至2024年的8.7亿美元,3年增长11倍。Surge AI零融资自举至超10亿营收,2025年7月以≥250亿美元估值洽谈融资,ARR至8月达14亿美元。Mercor于2025年10月估值达100亿美元,较2月翻5倍,管理3万+专家,日付150万美元,时薪约85美元,瞄准5万亿美元知识劳动市场。Snorkel AI估值约13亿美元,Turing估值约22亿美元。

连锁反应印证了“中立性即资产”:Meta入股Scale后,因数据机密性顾虑,Google、OpenAI、xAI等客户削减或暂停与Scale合作,为Surge、Mercor让出空间。数据供应行业的“中立性”本身即核心资产——当模型厂商担心自己的训练数据被竞争对手获取时,独立的数据服务商获得了结构性优势。

RLHF与专家数据——价值高地

在八层数据价值链中,RLHF/偏好数据和专家/领域数据处于高价值区间。RLHF决定模型“好用”程度——让模型说“人话”、符合人类价值观,是头部模型差异化竞争的关键。专家/领域数据(PhD级)突破专业能力天花板,溢价最高的人工数据。医疗、法律、编程等高壁垒领域的专家标注数据,是模型专业能力的天花板。

标注单价随专业度上升呈阶梯式增长:通才标注每件仅几美元→领域基础级(需培训)每件几十美元→专家级(需PhD)每件可达数百美元,价差可达数十倍。业界观察表明,模型性能提升中归因于数据质量(而非架构)的比例超过70%。价值正从“规模化通用标注”流向“专家判断、独家授权与具身多模态”。

合规成为护城河

截至2025年10月,全球追踪到的AI版权诉讼达51-166起。欧盟《AI法案》Article 53(1)(d)要求按AI Office模板公开训练内容“充分详细摘要”,披露数据类型及来源。中国AIGC版权裁决已确立态度:北京互联网法院首例AI生成图片版权案判赔5000元;广州互联网法院全球首例GenAI输出侵权裁决判赔1万元;杭州互联网法院LoRA案判赔3万元。可审计、可溯源的合规授权数据获得结构性溢价,合规从“成本项”转为“定价项”。

中国数据标注市场

据信通院测算,2024年中国数据标注产业规模约120亿元,核心企业超600家。7大国家数据标注基地已赋能121个国产大模型。日均Token消耗达140万亿(2026年3月,国家数据局),较2024年初增长1000多倍。三大政策支柱——“数据要素×”三年行动、数据资源入表、数据标注产业专项——正加速推动中国数据市场从“规模扩张”走向“质量提升”。中国厂商正集中卡位多模态与垂直象限:海天瑞声(语音/多模态·已上市)、澳鹏中国/曼孚科技(自动驾驶·标注)、艺恩(垂类数据)等正与全球价值迁移方向一致。市场核心命题正由“数据规模”转向“数据质量、专业度与合规性”——这是数据标注与RLHF市场未来5年的主旋律。
点击阅读报告原文: 艺恩:2026全球大模型数据市场白皮书(35页)
相关报告