返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

AI训练数据市场分析

Scale AI年收入从8000万美元跃升至8.7亿美元仅用了3年——这不是偶然的业绩爆发,而是全球大模型数据市场正在经历的结构性变革的缩影。艺恩数据这份白皮书揭示了AI训练数据市场的真实规模:广义口径2024年约60-90亿、2025年约100-160亿美元,年复合增速达20%-35%。核心判断是:当公开语料枯竭(预计2028年),谁掌握了高质量、合规、专业化的数据资产,谁就掌握了AI时代的定价权。

市场规模的真实全景

常被引用的“AI训练数据集”狭义口径仅约28-32亿美元,严重低估了真实市场。真实支出多在标注、RLHF/专家数据服务中,而非打包数据集。Scale(约20亿)+Surge(约14亿)+Mercor(约7.6亿)2025年毛收入合计约42亿美元,已超过整个“训练数据集”的全球估值。本白皮书采用广义口径(数据集+采集标注+RLHF/专家数据+合成数据),自下而上测算2024年约60-90亿、2025年约100-160亿美元。不同细分赛道高速增长共振:训练数据集、采集与标注、RLHF/专家数据、合成数据四个赛道均在扩张。NVIDIA于2025年以约3.2亿美元收购合成数据公司Gretel.ai,标志头部算力厂商正式将合成数据纳入战略版图。Stanford HAI《2025 AI Index》指出:训练计算量每5个月翻倍,数据集规模每8个月翻倍——数据需求的指数级膨胀是各赛道高增速的根本驱动。

公开语料枯竭——“数据墙”逼近

Epoch AI(经ICML 2024同行评审)测算,可用人类公开文本存量约300万亿token,训练数据集规模预计在2026-2032年间与之持平,中位数预测约2028年。Common Crawl约130万亿、索引网络约510万亿token,但高质量部分远小于此。过度训练加速耗尽——Llama 3过度训练约10倍。行业领袖的判断印证了这一趋势:Elon Musk表示“人类知识的累积总和已基本在AI训练中被耗尽——大体上去年就发生了”;Sam Altman指出核心问题是“如何从更少的数据中学到更多”。四条出路正在成型:多模态扩容、合成数据、数据效率与策展、高质量/专家数据。

八层价值链——价值递进与溢价分布

数据价值链从底层到顶层呈现清晰的价值递进。预训练语料(web/书籍/代码)是规模化基础,边际价值随枯竭下降;SFT指令微调数据对齐任务格式,塑造可用性;RLHF/偏好数据对齐人类偏好,决定“好用”程度;RLAIF/AI反馈数据降低人工成本规模化对齐;专家/领域数据(PhD级)突破专业能力天花板,溢价最高;评测/基准数据是能力度量与迭代方向的标尺;合成数据是缓解数据墙、增速最快的新供给;多模态数据(图像/视频/4D)最稀缺、溢价最高。越靠近“专家级、多模态、可验证”的一端,单位价值越高、可复制性越低。业界观察表明,模型性能提升中归因于数据质量(而非架构)的比例超过70%。同一份标注,随专业度上升(通才→专家)价差可达数十倍。

合规溢价与市场格局

截至2025年10月,全球追踪到的AI版权诉讼达51-166起。法院核心分野正在形成——“合法获取”可能构成合理使用,“盗版内容”则明确不被宽宥。美国已有3位法官就AI训练合理使用裁决(2支持训练方、1反对),均强调训练“高度转化性”,但严格区分内容获取来源是否合法。欧盟《AI法案》Article 53(1)(d)要求按AI Office模板公开训练内容“充分详细摘要”。可审计、可溯源的合规授权数据获得结构性溢价,合规从“成本项”转为“定价项”。

美国前沿数据公司估值已达软件级:Scale AI≈290亿、Surge AI≈250亿、Mercor≈100亿、Turing≈22亿、Snorkel AI≈13亿。中国玩家则多为“盈利但体量小”的上市/挂牌企业:海天瑞声2025年营收3.77亿元(+59%)、数据堂3.62亿元(+49.2%)、澳鹏中国约7.3亿元(+74.8%)、艺恩数据营收+49.86%。中国已发布大模型1509个,全球第一,日均Token消耗达140万亿。六大趋势:合成数据走向主导、专家人类数据崛起、数据飞轮成护城河、从规模转向质量专业化、具身AI与世界模型成增长极、中美双核两套路径。
点击阅读报告原文: 艺恩:2026全球大模型数据市场白皮书(35页)
相关报告