返回顶部
返回首页 会员充值 我的足迹 返回上一页
跳转三个皮匠报告小程序
具身智能
情绪经济
商业航天
十五五
银发经济

数据工厂白皮书

水电有厂,AI也该有“数据厂”。当96%的全球数据无法在互联网上直接流通,当行业高质量数据集“作坊式”生产严重不足,数据工厂应运而生。这部由北京交通大学、华为等30余家机构历时一年编制完成的白皮书,首次系统回答了“高质量数据集从哪里来”这一AI时代的核心命题——从三种类型到五大特征,从三个车间到四种建设模式,报告为数据要素的工业化生产提供了完整框架。

为什么需要数据工厂——AI“奇点时刻”的数据荒

2025年至2026年,人工智能产业经历质变。全国词元日调用量从2024年初的1000亿跃升至2025年底的100万亿,两年增长超千倍;2026年5月突破400万亿。AI推理数据量达101.34EB,首次超过训练数据量的98.14EB,人工智能正式从学习训练阶段转向应用推理阶段。
但高质量数据集的供给严重滞后。报告揭示了一个惊人事实:在互联网上能直接流通的数据仅占全球数据总量的不到4%,96%的数据无法在互联网上直接流通——其中16%是非结构化多模态数据,另外80%是涉隐涉密的私域数据。这两类“供不出”的数据,恰恰是高质量数据集构建和AI应用的刚需。
截至2026年3月,全国已建成高质量数据集超过11.6万个,总规模超过960PB,相当于中国国家图书馆数字资源总量的336倍左右。但这一数字与海量数据生产总量相比仍显不足。2025年我国数据生产总量为52.26ZB,同比增长27.28%,占全球约27.44%。从数据到高质量数据集的“价值化”过程,需要清洗、标注、加工、分析等复杂流程,投入产出不成比例、专业人才短缺等问题严重阻碍了这一进程。

数据工厂的定义与架构——三个车间、三种类型、五大特征

报告给出了清晰定义:数据工厂是人类社会进入数智化发展新阶段,面向人工智能大模型应用,开展高质量数据集设施化、规模化、标准化生产的数据基础设施。
狭义数据工厂由三个车间组成。储备车间定位于数据原料的“供应基地”,包含数据采集中心、存储中心和管理中心三大平台,负责数据的规模化收储、标准化预处理和体系化管理。建设要点包括数据多样性规划、汇聚管道化、标准化处理、多模态湖存储和多维度数据管理。
生产车间定位于高质量数据集“流水线”,包含数据加工中心和数据标注中心,以及清洗、合成、增强、标注、质检、数据集管理六大模块。它实现从作坊式生产到规模化供给、从零散式建设到体系化构建、从分散化工具到平台化设施的根本转变。
中试车间定位于数据集投产前的“靶场”,包含模型评估中心和数据集维护更新中心。通过模型训练评估、微调评估、推理评估和数据集迭代四大模块,确保数据集符合模型训练要求。这是数据工厂区别于传统数据标注企业的关键差异——不只是“生产数据”,还要“验证数据能用”。
根据物理分布、组织方式和技术水平,数据工厂分为三种类型。集中式数据工厂将全过程集中在一个固定物理区域内,是未来五年内的主流方式。半集中式数据工厂采用相对统一的技术平台在不同区域开展不同领域的数据生产。分布式数据工厂通过数据虚拟化和连接器框架实现“逻辑统一、物理解耦”,特别适用于国防、金融、医疗等安全要求极高的行业。三种类型各具优势,将长期共存。
数据工厂呈现五大特征:多样化(三种形态长期共存)、设施化(本身即是设施的集合)、规模化(专业分工基础上的社会化大生产)、标准化(面向全社会提供通用化产品)、AI化(人工智能贯穿“采存算管用”全环节)。

数据工厂的全球探索——从Scale AI到帕西尼

国外数据工厂实践可归纳为三种模式。第一种是“半集中式”模式,以美国Scale AI为代表。该公司2016年成立,2021年获得美国军方2.5亿美元合同后快速发展,构建了覆盖通用、生成式AI、公共部门、汽车等领域的专业化数据引擎矩阵。2025年6月,Meta以143亿美元收购其49%股份。
第二种是“集中式”模式,以美国“星际之门项目”和欧洲数据中心为代表。星际之门总投资5000亿美元,计划于2029年完成,建设容量可达20EB的独立数据中心,把高质量数据明确定位为“国家战略资产”。欧洲数据中心由德国施瓦茨数字公司和德国铁路公司2024年合作成立,汇聚自动驾驶、医疗、遥感等领域数据,强调数据主权和GDPR合规。
第三种是“分布式”模式,以Palantir为代表。其Foundry平台支持连接200多种数据源,在客户原有系统上就地完成处理,无需集中搬迁数据即可实现跨系统整合。
国内实践同样丰富。崖州湾国家实验室2025年11月发布“繁|未来农业智能枢纽”,已上线8类数据库、3000+基因组、35000+样本数,可提升育种效率30%。贵州主枢纽存力中心可调度算力4.5EFLOPS、存力980PB,存算用户90%以上来自省外。上海库帕思科技构建“1125”业务架构,语料工具链平台2.0包含403个功能模块,日生成语料接近1TB。
帕西尼具身智能超级数据工厂2025年6月在天津投用,占地近12000平方米,部署150个标准化采集单元,预计年产近2亿条多模态训练数据,首创“无本体依赖”数据采集技术。

数据工厂的建设、运营与部署——四种模式、四种运营、四级部署

数据工厂可通过四种模式建设。数据标注企业升级——海天瑞声、数据堂等传统标注龙头通过技术改造向数据工厂跃迁。数据存储基地转型——“八大枢纽十大集群”及华为、浪潮等存储基地,通过存储厂商与数据源机构合作共建。人工智能企业延伸——DeepSeek、Kimi等头部AI企业将数据业务拓展为独立业务。技术企业创新设立——通过数据编织、数据虚拟化等前沿技术构建分布式数据工厂。
运营层面同样分为四种模式。保障模式针对国家重大战略需求,数据无条件供给、数据集有条件无偿开放。定制模式针对社会公益和技术创新需求,数据按需求有条件供给、数据集定向开放。电商模式针对市场化基础较好的领域,数据通过授权运营方式提供、数据集按市场规则开放。结对子模式针对智慧医疗、智能驾驶等重点领域,数据优先提供、数据集有偿定向供给。
部署策略与国家数据基础设施协同。底座部署通识数据集数据工厂,服务基础大模型。区域重要功能设施部署区域通识数据集数据工厂,体现地方资源特色。行业重要功能设施部署行业通识数据集数据工厂,服务行业垂域大模型。各业务节点部署行业专识数据集数据工厂,服务智能体和垂直大模型。
点击阅读报告原文: 北京交通大学:2026数据工厂白皮书(138页)
相关报告