返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

2026全球大模型数据市场白皮书

当OpenAI、Google、Meta等头部玩家发现互联网上的公开文本语料正以每年翻倍的速度被消耗殆尽时,数据市场正在经历一场从“规模”到“质量”的结构性重构。艺恩数据这份白皮书揭示了关键转折点:全球AI训练数据市场年复合增速达20%-35%,公开语料预计2028年耗尽,ScaleAI获Meta 143亿美元投资估值290亿,Anthropic以15亿美元创下美国史上最大版权和解。核心判断是:数据正从“可廉价获取的原料”变为决定模型上限的稀缺生产要素。

市场与拐点——狭义口径失真,广义市场规模远超预期

常被引用的“AI训练数据集”狭义口径仅约28-32亿美元(2024-25),只统计打包数据集和标注软件。但真实支出多在标注、RLHF/专家数据服务中。Scale(约20亿)+Surge(约14亿)+Mercor(约7.6亿)2025年毛收入合计约42亿美元,已超过整个“训练数据集”的全球估值。本白皮书采用广义口径(数据集+采集标注+RLHF/专家数据+合成数据),自下而上测算2024年约60-90亿、2025年约100-160亿美元(毛口径买方支出)。

公开语料枯竭的三重证据

Epoch AI(经ICML 2024同行评审)测算,可用人类公开文本存量约300万亿token,训练数据集规模预计在2026-2032年间与之持平,中位数预测约2028年。三重证据支撑这一判断:存量有限分层——Common Crawl约130万亿、索引网络约510万亿token,但高质量部分远小于此;过度训练加速耗尽——Llama 3过度训练约10倍,若转向100倍则数据触顶更早;多轮训练放大3-15倍有效存量,但难以根本解决枯竭。Elon Musk在2025年1月表示“人类知识的累积总和已基本在AI训练中被耗尽——大体上去年就发生了”;Sam Altman指出核心问题是“如何从更少的数据中学到更多”。

四条出路正在成型:多模态扩容(引入图像/视频/音频可使训练数据约增3倍)、合成数据(以模型生成数据反哺训练)、数据效率与策展(更少但更优质数据获更强能力,即“数据中心化AI”)、高质量/专家数据(通用语料见顶,稀缺的专业、垂直、合规语料价值凸显)。

八层价值链与估值狂飙

数据价值链从底层到顶层呈现清晰递进:预训练语料→SFT指令微调→RLHF/偏好数据→RLAIF/AI反馈→专家/领域数据→评测/基准→合成数据→多模态数据。越靠近“专家级、多模态、可验证”的一端,单位价值越高。业界观察表明,模型性能提升中归因于数据质量(而非架构)的比例超过70%。

头部交易重塑估值体系:Scale AI在2025年6月获Meta 143亿美元投资,估值290亿美元;Surge AI ARR达14亿美元,以≥250亿美元估值洽谈融资;Mercor 2025年10月估值达100亿美元,较2月翻5倍。Meta入股Scale后,因数据机密性顾虑,Google、OpenAI、xAI等客户削减或暂停合作,为Surge、Mercor让出空间——“中立性”本身即核心资产。

合规成为护城河

截至2025年10月,全球追踪到的AI版权诉讼达51-166起。法院核心分野正在形成——“合法获取”可能构成合理使用,“盗版内容”则明确不被宽宥。欧盟《AI法案》2024年8月1日生效,Article 53(1)(d)要求按AI Office模板公开训练内容“充分详细摘要”,披露数据类型及来源。合规数据获得结构性溢价,合规从“成本项”转为“定价项”。中国AIGC版权裁决已确立态度:北京互联网法院首例AI生成图片版权案判赔5000元,广州互联网法院全球首例GenAI输出侵权裁决判赔1万元。

中国数据市场与六大趋势

中国已发布大模型1509个,数量全球第一(占全球约40%),AI企业超5300家。日均Token消耗达140万亿,较2024年初增长1000多倍。三大政策支柱——“数据要素×”三年行动、数据资源入表、数据标注产业专项——正加速推动中国数据市场发展。六大趋势:合成数据走向主导(Gartner预测2030年合成数据将超真实数据)、专家人类数据崛起、数据飞轮成护城河、从规模转向质量专业化、具身AI与世界模型成增长极、中美双核两套路径。胜负手正从“更多算力”转向“更优质、更合规的数据”——公开语料枯竭不是终点,而是数据价值化的起点。
点击阅读报告原文: 艺恩:2026全球大模型数据市场白皮书(35页)
相关报告