DeepSeek让算力不再稀缺,开源让算法不再封闭,但AI在千行百业的落地仍被一道无形之墙阻挡——“数据平权”尚未到来。互联网上可直接流通的数据仅占全球总量的不到4%,高价值行业数据大多分散在各部门各企业,非结构化数据采集难度大、成本高。人工智能数据供给的困局,正成为制约AI产业发展的最大变量。而数据工厂,正是对这一困局的直接回应。
人工智能数据供给的三大困局
当前AI数据供给面临三重结构性矛盾。
第一,数据资源“供不出”。在互联网上能直接流通的数据仅占全球数据总量不到4%,还有96%的数据都不能在互联网上直接流通。其中16%是非结构化的多模态数据,另外80%是涉隐涉密的私域数据。这两类“供不出”的数据正是高质量数据集构建和AI应用的刚需。非结构化数据采集难度大、成本高,标准难以统一,标注自动化程度低。
第二,行业数据“存不好”。高价值行业数据分散保存在各部门各企业,难以实现集中化和规模化。据统计每年未使用的数据占比约四成。缺少完善的数据保存规范和指引,导致各行业数据保存规模和质量参差不齐。美国国家安全局明确电子通信数据的存储周期达100年,荷兰要求医疗机构将医疗影像数据长期存储达100年,而我国部分行业虽然在信息化阶段对部分数据制定了存储范围和周期,但主要考虑数据安全而非数据价值挖掘。
第三,高质量数据集“作坊式”生产效率低下。面向行业应用的高质量数据集供给严重不足。专业化数据的高质量标注需要庞大资金投入,场景化加工程度不足,数据加工技术存在优化空间,专业人才供给难以满足需求。当前高质量数据集构建工具缺乏、标准不统一、智能化程度低,表现出分散化、个体化、零碎化特点。
数据供给的新范式——从“副产品”到“专门生产”
传统模式下,数据是业务发展的“副产品”——数据“采存算管用”等治理活动是企业的“副业”。大多数企业数据加工处理能力弱,高质量数据集生产能力不足而无力提供。同时,高价值数据往往与企业核心业务紧密耦合,有加工能力的机构很难获得这些高价值数据进行处理并对外提供。
数据工厂提供了全新的供给范式:建设独立业态的数据工厂,通过数据脱敏、匿名化处理等手段实现数据与业务解耦,并通过专业化、规模化的社会大生产方式,实现高质量数据集的规模化生产和供给。这一范式从根本上突破AI技术水平提升和应用范围拓展的“最初一公里”瓶颈。
数据工厂作为AI数据供给的新范式,具有三个显著特点。设施化——将当前各行业使用的各种技术、工具进一步规范化、平台化、设施化,形成智能化、自动化的采集汇聚、清洗标注、加工处理、检验测试等工具和设施。规模化——数据是数据工厂的核心业务,最终产品是大规模的、业态多样的、各种类繁多的高质量数据集。标准化——面向各行业各领域各企业的需要,提供全社会各类主体都能使用的高质量数据集。
数据供给的实践验证——国内外案例如何破解“数据荒”
Scale AI的实践证明了专业化数据供给的商业可行性。2021年获得美国军方2.5亿美元合同后,其业务迅速扩展到商业领域,主要客户包括OpenAI、英伟达、Meta、微软、美国国防部。其成功的关键在于构建了覆盖“数据标注—数据管理—模型评估—AI应用”全链条的服务能力,形成数据生产与模型优化、应用部署的完整闭环。
帕西尼具身智能超级数据工厂展示了如何填补特定数据模态的空白。工厂特别注重填补触觉模态数据的空白,通过与视觉等信息的对齐,重点解决智能体在未知场景中表现不佳的泛化性差问题。工厂预计每年可生产近2亿条包含丰富维度的高质量训练数据,汇聚成全模态数据集,为行业提供标准化的数据基座。
贵州主枢纽存力中心展示了区域数据供给的规模化效应。依托国家“东数西算”工程,以贵安新区为核心集中汇聚47个重点数据中心,可调度算力达4.5EFLOPS、存力980PB。存算用户90%以上来自省外,已形成“东数西算”“东数西训”“东数西渲”等多元服务模式。
京津冀数据要素产业园人工智能数据工厂展示了数据供给如何与实体经济深度融合。项目总投资2.6亿元,拥有100PB存力,3个月上线可用存力25PB、签约合同额突破2000万元。“霸州云厨”依托存力中心建立起覆盖从田间生产基地到学校餐桌的全链条数据汇聚机制,让每一份食材都有了数字身份证。
AI数据供给的未来方向——政策、标准、技术、平台协同发力
破解AI数据供给困局需要系统施策。报告建议从四个方向协同发力。
政策先行。建议加快出台《关于促进数据工厂新业态创新发展的指导意见》,加大数据资源供给,加快推进国家数据基座建设,建立行业数据汇聚激励机制,完善公共数据开放政策,在政府采购中增列数据采购预算。
标准引领。建议启动数据工厂相关标准研制,构建覆盖数据资源汇聚、数据集生产、质量评估、流通应用的全链条标准体系。重点研制《国家数据基座 行业数据资源汇聚目录规范》《国家数据工厂 参考架构标准》《高质量数据集 模型适配性评估规范》等。
技术突破。建议将数据工厂关键技术纳入国家科技计划支持范围,重点攻关神经形态传感器等非结构化数据采集技术、AI数据湖存储等海量数据存储管理技术、基于大语言模型的智能清洗等智能化数据加工技术、数据集质量智能评估等质量评估技术。
平台支撑。建议建设数据资源汇聚平台、数据集生产平台、统一数据流通基础设施和人工智能训练平台四大支撑平台。加快推进国家数据基础设施技术路线融合收敛,推动数据工厂与国家数据基础设施同步规划、协同部署。
当“数据平权”成为AI普及的最后堡垒,数据工厂的全面铺开,将决定中国AI产业能走多远。