返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

公开语料耗尽趋势

人类知识的累积总和已基本在AI训练中被耗尽——Elon Musk在2025年的这句断言,正在被数据科学家的测算所验证。Epoch AI(经ICML 2024同行评审)测算,可用人类公开文本存量约300万亿token,训练数据集规模预计在2028年前后与之持平。艺恩数据这份白皮书系统梳理了“数据墙”的三重证据与四条出路,核心判断是:公开语料枯竭不是终点,而是数据价值化的起点——谁能在“后枯竭时代”掌握高质量、合规、专业化的数据资产,谁就掌握了定价权。

“数据墙”的三重证据

Epoch AI的测算给出了清晰的临界点:可用人类公开文本存量约300万亿token,若当前趋势持续,训练数据集规模将在2026-2032年间与之持平,中位数预测约2028年。三重证据支撑这一判断。

存量有限分层。Common Crawl约130万亿、索引网络约510万亿token,但高质量部分远小于此。互联网上的文本数据并非“取之不尽”——大量内容是低质量、重复或噪声,真正可用于高质量模型训练的语料远比总量少得多。

过度训练加速耗尽。Llama 3过度训练约10倍;若转向100倍过度训练,数据触顶将更早到来。模型厂商为了在有限数据中榨取更多性能,正在以越来越高的倍数重复训练同一语料,这加速了“有效数据”的消耗速度。

多轮训练放大3-15倍有效存量,但难以根本解决枯竭。数据增强和重复采样技术可以暂时缓解数据不足,但无法逆转语料总量有限这一根本约束。

行业领袖的判断

行业领袖的判断与学术测算相互印证。Elon Musk在2025年1月表示:“人类知识的累积总和,已基本在AI训练中被耗尽——大体上去年就发生了。”Sam Altman在2024年指出核心问题是“如何从更少的数据中学到更多”,并承认“如果训练模型的最佳方式是生成一千万亿token合成数据再喂回去,那会很奇怪”。这些判断共同指向一个现实:数据规模的增长已触及天花板,行业必须寻找新的增长范式。

四条出路与行业应对

面对数据墙的逼近,行业正在从四个方向寻找出路。

第一,多模态扩容。引入图像、视频、音频数据可使训练数据量约增3倍(Epoch AI)。视频数据的信息密度远高于文本,且存量巨大——YouTube、TikTok等平台每日产生海量视频内容。

第二,合成数据。以模型生成数据反哺训练,成为缓解数据荒的核心路径。NVIDIA于2025年以约3.2亿美元收购合成数据公司Gretel.ai,标志头部算力厂商正式将合成数据纳入战略版图。Gartner预测合成数据占比将于2030年全面超越真实数据。

第三,数据效率与策展。更少但更优质的数据获得更强能力,“数据中心化AI”兴起。业界观察表明,模型性能提升中归因于数据质量(而非架构)的比例超过70%。高质量数据策展正在成为核心竞争力。

第四,高质量/专家数据。通用语料见顶,稀缺的专业、垂直、合规语料价值凸显。标注单价随专业度上升呈数十倍价差——通才标注到专家标注可达数十倍溢价。

核心结论

公开语料枯竭非终点,而是数据价值化的起点。三条结构性信号清晰可见:峰值数据逼近——公开语料趋于枯竭,价值向高质量、专家级、合规与合成数据迁移;资本空前涌入——数据与专家公司估值集体飙升,内容授权走向规模化;合规成为护城河——诉讼频发叠加欧盟透明度义务,合规数据获显著溢价。胜负手正从“更多算力”转向“更优质、更合规的数据”。当算力竞赛逼近边际、公开互联网语料趋于枯竭,数据已从“可廉价获取的原料”转变为决定模型上限的稀缺生产要素。
点击阅读报告原文: 艺恩:2026全球大模型数据市场白皮书(35页)
相关报告