人工智能从“实验室”走向“产业界”,最大的瓶颈往往不在算法本身,而在数据——数据量不足、质量参差、场景适配性差。中国信通院这份报告提出了系统性解决方案:模数共振体系。通过通识与专识数据集协同布局、行业大模型与特色智能体联动发展、评测诊断驱动持续优化,构建分层递进的行业智能化赋能体系。苏州阿丘科技缺陷过检率降低90%、百度标注效率提升50%、优必选成本降低99%——这些落地成果背后,是一套可复制的产业方法论。
统筹数据集建设与模型优化——通识+专识的分层赋能
面向制造、金融、医疗、教育、交通、能源、政务等重点行业领域,整合公域数据与私域数据,建设覆盖行业核心专业知识和通用业务场景的高质量通识数据集,训练具备广泛行业理解能力的行业大模型。同时,聚焦特定细分领域和专业化场景,构建高知识密度、高标注精度的专识数据集,研发面向垂直场景的特色智能体。
通过通识与专识数据集协同布局、行业大模型与特色智能体联动发展,构建分层递进、有机融合的行业智能化赋能体系,全面提升人工智能服务实体经济的专业化水平与实用化效能。
评测驱动持续优化——从“评分”到“赋能”
面向行业大模型、特色智能体等多样化能力评估需求,构建特色化、定制化的评测数据集体系,充分发挥评测数据集在模型能力诊断中的基准标尺作用。针对不同行业应用场景的专业特性,建立覆盖知识理解、逻辑推理、任务执行、安全可控等多维度的分级分类评测标准。
强化评测结果的应用导向,将模型评测反馈作为行业高质量数据集建设和优化的重要依据,精准识别数据短板与能力缺口,指导数据集定向扩充与质量提升。通过构建“评测诊断→数据集定向优化→模型能力提升”的良性循环机制,推动评测体系从单一评分向持续改进赋能演进。
模数共振生态协同——破解数据孤岛与信任难题
推动各地区选择第三方中立机构、各央企选择集团公司或专业子公司作为建设运营主体,打造“模数共振空间”创新载体。重点研发能够承载跨主体数据汇聚和模型训练的软硬件基础设施,构建高性能算力支撑、数据安全流通、模型协同开发的技术底座。
同步制定跨主体数据协同、模型共建、收益分配、责任划分、安全保障的全链条管理机制,明确各方权责边界与利益共享规则,破解数据孤岛与信任难题。通过技术架构与制度设计的双轮驱动,构建开放协同、安全可控的模数共振生态。
关键要素保障——技术、标准、人才、生态四轮驱动
技术创新层面,实施模数共振“专项行动”或“揭榜挂帅”机制,聚焦人工智能算法模型、数据集质量评估、数据标注与增强、数据工程工具等关键领域开展攻关。标准引领层面,积极参与国际标准、国家标准及行业标准的研究制定,推动人工智能数据工程等重点标准的广泛落地应用。
生态培育层面,创新开展重点行业人工智能赋能新型工业化“深度行”系列活动,搭建模型企业、数据企业、应用单位等多元主体的常态化交流合作平台。人才建设层面,构建跨学科培养体系,重点培育既懂行业业务场景、又精通数据科学和模型技术机理的复合型高端人才队伍。