随着大模型技术的迅猛发展,数据集作为人工智能核心三要素之一,在算法趋同、算力普惠的竞争环境中正在构建难以复制的差异化壁垒。人工智能正在进入“数据驱动”新阶段,高质量数据集的建设不再是提升AI模型性能的关键,也是推动“人工智能+”行动落地的重要保障。
2025年7月,信通院人工智能研究所&清华大学&人工智能产业发展联盟共同牵头发布的《人工智能高质量数据集建设指南》,旨在为业界建设高质量数据及提供有实操价值的指导和参考。指南首度披露了八大行业的数据集建设内幕——原来AI的“聪明”,是靠这些高质量数据“喂”出来的!
💡 AI竞争的下半场,是“数据之战”。炼数据成金,AI才能变聪明。
背景
近年来,国家相关部委和地方政府围绕高质量数据集建设和运营、数据标注产业发展等出台系列政策,并通过投资奖补、标准制定和验证、样板案例建设等举措积极推进高质量数据集政策落地。党中央和国家的政策部署为业界推进高质量数据集建设提供了方向指引和根本遵循。
大量机构在高质量数据建设中面临目标定位模糊、实施路径碎片化与技术底座薄弱化三重挑战,不知道需要什么数据集、如何建设数据集、怎样评估数据集质量,制约了人工智能应用落地。
高质量数据集是指用于训练、验证和优化人工智能大模型而收集、整理、标注形成的覆盖行业核心专业知识和生产经营活动信息的数据资源集合。
💡 大模型技术的飞速演进,对数据集规模、多样性、质量等提出极高要求,业界迫切需要服务人工智能大模型发展的高质量数据集。
核心要点
01:高质量数据集炼化流程
高质量数据集建设需经历数据设计和采集、治理、标注、质检、运营等流程类似石油“炼化”过程中的勘采、粗炼、质检、运营等流程,推动原始数据资源迈向智能应用。
02:教育领域实践
把5万本教材变成AI的“名师讲堂”
🔹 实践: 高等教育出版社将71年积累的教材和课程,转化为高质量语料。他们甚至把复杂的数学公式都精准转码,确保AI能“理解”。
🔹 成效: 训练出的“龙凤”大模型,不仅能解题,还能像优秀教师一样分步骤启发、给予正向激励,成为一个有温度的AI家教。
03:科学领域实践
材料数据库让研发成本“砍半”
🔹 实践: 北京计算中心构建了覆盖八大类材料的科学数据库,整合了海量的计算和实验数据。
🔹 成效: 基于此研发的一款镍基高温合金,研发周期追平国外,成本却直接降了一半以上。AI正在让“试错式”科研成为历史。
04:通信领域实践
运维工程师有了“百科全书”级AI助手
🔹 实践: 中国移动浙江公司打造了网络运维数据集,让AI学会了分析复杂的网络信令和故障数据。
🔹 成效: 原本需要1小时分析的码流任务,现在10分钟内搞定,投诉处理效率提升15%以上,AI成了工程师们随叫随到的“超级大脑”。
05: 交通领域实践
15万条交规问答,让AI成“交管专家”
🔹 实践: 交通运输部科学院将政策、法规和标准转化成15万对高质量的问答数据。
🔹 成效: 训练出的大模型,能对复杂的交通法规进行精准智能问答,未来还将用于自动驾驶决策,让出行更安全高效。
06:工业领域实践
AI“火眼金睛”守护基站机房
🔹 实践: 中国铁塔构建了多模态数据集,让AI能通过视频识别设备毫米级的位移和细微的状态变化。
🔹 成效: 压缩机是否生锈、开关是否虚接,甚至盗窃行为都逃不过它的“法眼”,将安全隐患的发现从“小时级”提速到“秒级”。
07:医疗领域实践
听懂面瘫患者的“不标准”普通话
🔹 实践: 中科大构建了国内首个面瘫语音数据集,收录患者语音并标注对应的医学评估分数。
🔹 成效: 这让AI能更准确地识别病理性发音,为辅助诊断和康复跟踪提供了量化依据,让科技充满了人性的温度。
08:文化领域实践
2000人方言库,让智能设备听懂“乡音”
🔹 实践: 社科院语言所建成了覆盖十大方言区、2000人的方言语音库。
成效: 华为、科大讯飞等企业用它训练产品,让智能设备在方言区的普及率提升了15%。科技不再是标准普通话的专利,也能守护每个人的乡愁。
09:商贸领域实践
近13TB数据,让你“剁手”更爽
🔹 实践: 相关科技公司构建了总量约13TB的商贸数据集,涵盖直播语音、商品图片、客服对话等。
🔹 成效: 你之所以能在电商平台上被“猜中心思”,享受到流畅的客服和高效的物流,背后都是这些高质量数据在驱动。
💡 随着人工智能大模型应用从初步探索迈向更为复杂、智能的高阶阶段,对高质量数据集的规模、多样性、时效性以及处理速度的要求将会快速增长。
展望未来,数据集工程、技术创新、质量评估、版权合规以及基础制度建设是推进人工智能高质量数据建设的关键。
报告原文

- End -
来源:中国信通院

