《数据工厂白皮书》正式发布:中国第一本关于数据工厂政策、理论、时间的研究成果,北交大联合业内产学研用近30家机构共同研究编制(附下载)

2026年7月16日,“数据工厂研讨暨《数据工厂白皮书》发布会”在北京交通大学举行,来自全国各地数据集团、中央企业、科技企业、高等院校、其他机构的100多位代表参加了会议。

会议由北京交通大学经济管理学院和北京交通大学信息管理理论与技术国际研究中心联合主办。北京交通大学信息管理理论与技术国际研究中心执行主任宫大庆教授主持会议。

640-21

发布现场

640-23

北京交通大学信息管理理论与技术国际研究中心执行主任宫大庆教授

北京交通大学经济管理学院副院长李红昌教授、北京交通大学信息中心主任刘世峰教授分别代表主办单位发表欢迎致辞,全国数据标准化技术委员会副秘书长张群、国家数据发展研究院专家王威为研讨会致辞。

640-24

北京交通大学经济管理学院副院长李红昌教授

640-22

北京交通大学信息中心主任刘世峰教授

640-25

全国数据标准化技术委员会副秘书长张群

640-26

国家数据发展研究院专家王威

贵州大数据产业集团公司党委书记、董事长李旭,全国数据标准化技术委员会副秘书长张群,国家数据发展研究院专家王威,华为数据存储产品线副总裁杨文道、北京交通大学张向宏教授,共同揭幕正式发布了《数据工厂白皮书》。

640-28

发布仪式图片

国家数据专家咨询委员会委员、全国数据标准化技术委员会数据基础设施工作组组长、北京交通大学教授张向宏对《数据工厂白皮书》进行了详细解读。华为公司、北京数交所、贵州大数据集团、崖州湾国家实验室、呼和浩特互联网协会等代表进行了实践分享。

国家数据专家咨询委员会委员、全国数据标准化技术委员会数据基础设施工作组组长、北京交通大学教授张向宏对《数据工厂白皮书》进行了详细解读。

640-27

国家数据专家咨询委员会委员、全国数据标准化技术委员会数据基础设施工作组组长、北京交通大学教授张向宏

华为数据存储产品线副总裁杨文道做了题为《筑基先进数据工厂基础设施 加速高质量数据集规模化供给》的主旨演讲。

640-29

华为数据存储产品线副总裁杨文道

北京国际大数据交易所副总经理温天宁做了题为《北数所高质量数据集方案》的主旨演讲。

640-30

北京国际大数据交易所副总经理温天宁

贵州大数据产业集团有限公司副总经理雷宏做了题为《贵州大数据集团数据工厂探索分享》的主旨演讲。

640-31

贵州大数据产业集团有限公司副总经理雷宏

崖州湾国家实验室高级研究员袁晓辉做了题为《繁:未来农业智能枢纽》的主旨演讲。

640-32

崖州湾国家实验室高级研究员袁晓辉

呼和浩特市互联网协会秘书长张晓宇做了题为《数据工厂:内蒙古在数智时代的新赛道新机遇》的主旨演讲。

640-33

呼和浩特市互联网协会秘书长张晓宇

白皮书基本情况

北京交通大学经济管理学院副院长李红昌,北京交通大学信息中心主任、教授刘世峰,全国数据标准化技术委员会副秘书长张群,国家数据发展研究院数据资源研究部主任王威出席发布会并致辞发言;国家数据专家咨询委员会委员、全国数据标准化技术委员会数据基础设施工作组组长、北京交通大学教授张向宏解读《白皮书》,华为数据存储产品线副总裁杨文道、北京国际大数据交易所副总经理温天宁、贵州大数据产业集团副总经理雷宏等企业和机构代表做了实践分享。

《白皮书》是中国第一本关于数据工厂政策、理论、时间的研究成果,由北京交通大学、北京化工大学牵头,联合华为、蚂蚁、北京数据集团等30余家单位历时一年完成,首次系统明确数据工厂的涵义、类型划分与主要特征,为国内数据要素产业建设与人工智能场景落地提供体系化参考。

白皮书编制工作依托国家数据局委托的专项研究项目开展。编制团队在原有课题结题成果基础上,面向全国开展广泛实地调研,对研究内容进行大幅扩充升级。《白皮书》共分为“数据工厂新业态发展方兴未艾”“国内外数据工厂探索实践概况”“数据工厂的涵义、类型和特点”“数据工厂的构成、定位和功能”“数据工厂的建设、运营和部署”“发展数据工厂新业态政策建议”等六个章节。

《白皮书》结合《2025年全国数据资源调查报告》等行业调研数据研判,当前人工智能已发展到奇点时刻,词元调用量爆炸式增长,推理数据量首次超过训练数据量,计算驱动成为数据生产主要方式,智能体成为互联网的主要操作者。但与此同时,高质量数据集成为人工智能瓶颈。

针对行业发展,《白皮书》首次对“数据工厂”作出定义,指出其不仅是高质量数据集规模化生产设施和新型业态,也是国家数据基础设施的重要组成部分。数据工厂具备面向大规模数据资源的存储、治理、加工、流通等服务能力,可显著降低数据归集、存储、加工和治理成本,为人工智能训练提供规模化高质量数据集。提出,数据工厂是国家数据基础设施基本构成单元,是突破人工智能发展瓶颈的有效手段,是高质量数据集的规模化生产设施,也是数据全生命周期的综合产业形态。

《数据工厂白皮书》首次对“数据工厂”作出定义,并对数据工厂建设提出四点建议。

《白皮书》还提出,根据物理分布、组织方式和技术水平等特征,数据工厂可以分为集中式数据工厂、半集中式数据工厂和分布式数据工厂等三种不同类型,数据工厂的三种形式特点各异、各有优势,并将在今后很长一段时间内长期共存。

在主要特征方面,《白皮书》提出数据工厂具备五方面显著特点,一是多样化,二是设施化,三是规模化,四是标准化,五是AI化。

《白皮书》同时明确数据工厂的构成、定位和功能,认为数据工厂的构成有广义和狭义两个范畴,广义数据工厂是指站在国家宏观角度,构建一个以数据为主要对象,包括数据供应、数据生产、数据交付、数据应用的一个数据生态系统,包括国家数据基座、国家数据工厂和国家人工智能训练场三个部分。狭义数据工厂是指站在企业、行业和区域微观角度,构建一个面向人工智能大模型应用,开展高质量数据集设施化、规模化、标准化生产的数据基础设施。

围绕具体建设落地,《白皮书》指出,根据建设主题的原有基础和条件,数据工厂可以通过数据标注企业升级、数据存储基地转型、人工智能企业延伸和技术企业创新设立等四种模式建设。

《白皮书》同时梳理了国内外数据工厂领域的探索进展。海外已有多家企业和项目形成不同模式的实践样本,国内多地也结合自身禀赋开展布局。贵州、广东等东数西算枢纽节点正推动算力中心向数据工厂转型,上海、天津分别在数据要素平台、具身智能数据领域形成特色探索,农业等垂直行业也出现相关试点。据统计,目前全国已有28个省市将数据工厂纳入数字经济重点工作。

围绕产业长远发展,《白皮书》提出四方面建议。一是加快制定促进数据工厂发展政策,二是启动数据工厂相关标准研制,三是突破数据工厂关键技术瓶颈,四是加强数据工厂支撑平台建设。

白皮书核心内容

《数据工厂白皮书》由数据工厂新业态发展方兴未艾,国内外数据工厂探索实践概况,数据工厂的含义、类型和特点,数据工厂的构成、定位和功能,数据工厂的建设、运营和部署,发展数据工厂新业态政策建议等六个章节组成。

第一部分“数据工厂新业态发展方兴未艾”,从人工智能已发展到奇点时刻、面向人工智能的数智产业链已经形成、数智产业链还存在三个薄弱环节、数据工厂是高质量数据集规模化生产的关键设施四方面,阐述了发展数据工厂的必要性和紧迫性。

第二部分“国内外数据工厂探索实践概况”,分别对Scale AI、美国星际之门项目、欧洲数据中心、欧洲数据实验室、Parse Biosciences、Bioptimus、笛卡尔实验室等国外典型数据工厂,崖州湾国家实验室“繁|未来农业智能枢纽”超级数据工厂、贵州主枢纽存力中心暨数据要素保障基地、库帕思“语料超级工厂”、京津冀数据要素产业园人工智能数据工厂、广东省先进存力中心、帕西尼具身智能超级数据工厂、上海徐汇区“模速空间”、北京经开区“模数世界”、珠海市“模数空间”、北京市石景山区“大模型超级工厂”等国内典型数据工厂的实践,以及国内数据工厂的共性特征进行了论述。

第三部分“数据工厂的涵义、类型和特点”,提出数据工厂是高质量数据集规模化生产设施和新型业态,是国家数据基础设施的重要组成部分的基本涵义。数据工厂有集中式、半集中式和分布式三种类型。数据工厂有多样化、规模化、体系化、标准化、AI化等五大特点。

第四部分“数据工厂的构成、定位和功能”,分别从广义数据工厂和狭义数据工厂的角度,提出广义数据工厂包括国家数据基座、国家数据工厂、国家人工智能训练场等三部分。狭义数据工厂包括储备车间、生产车间和中试车间三部分。其中,储备车间定位于数据原料“供应基地”,包括“三中心、五模块、多方法”体系;生产车间定位于高质量数据集“流水线”,包括“两中心、六模块、多工具”体系;中试车间定位于高质量数据集“靶场”,构建“模型评估、数据集维护和更新”体系。

第五部分“数据工厂的建设、运营和部署”,论述了数据标注企业迭代、数据存储基地升级、人工智能企业延伸和技术企业创新创立四种数据工厂建设模式,保障模式、定制模式、结对子模式、电商模式四种数据工厂运营机制,与国家数据基础设施协同部署,在国家基础设施底座应部署通识数据集数据工厂,在重要功能设施应部署行业通识数据集数据工厂,在各业务节点应部署行业专识数据集数据工厂等三种数据工厂部署策略。

第六部分“发展数据工厂新业态政策建议”,从政策、标准、技术、平台四方面,提出加快出台《关于促进数据工厂新业态创新发展的指导意见》、启动数据工厂相关标准研制、突破数据工厂关键技术瓶颈、突破数据工厂关键技术瓶颈等发展数据工厂的四项建议。

“智慧城市行业分析”公众号

公众号“智慧城市行业分析”回复关键字“数据工厂白皮书”,获取报告下载地址

专家解读

640-34

围绕何为数据工厂、建设数据工厂的核心动因、数据工厂具备何种核心价值等行业关键问题,近日,《证券日报》记者专访《数据工厂白皮书》主编、北京交通大学信息管理理论与技术国际研究中心(ICIR)教授张向宏。

发展数据工厂迫在眉睫

在阐释发展数据工厂新业态为何势在必行、刻不容缓时,张向宏指出,背后共有五大现实动因。

一是人工智能普及应用遇到了“数据墙”。据《全国数据资源调查报告(2025年)》,2025年全国人工智能应用量接近200EB,而推理数据量达到101EB,超过了训练数据量的99EB,表明人工智能正发生从训练学习到推理应用的转变“拐点”,词元调用量的迅猛增长、人工智能数据生产方式、智能体成为HTML网页的主要操作者,以及全行业数据开发率和人工智能应用率大幅提升等更多数据都指向了一个共同的事实——人工智能发展已到了奇点时刻。然而,人工智能大模型的应用现在还处于非常初级的发展阶段,通用大模型除在文书和编程两个领域开始规模应用外,多数大模型的应用还停留在作诗、作画、跳舞、跑步等浅层面的“娱乐”阶段,距离个人工作学习、企业生产经营、政府管理服务等日常活动还差之甚远。其中,一个根本问题是——人工智能普及应用遇到了“数据墙”。

二是面向人工智能的数智产业链已经形成。面向人工智能的数智产业链由四阶段组成。上游包括通识高质量数据集和通用大模型。中上游包括行业通识高质量数据集和行业大模型。中下游包括行业专识高质量数据集和智能体。下游则是智能体在各行各业的应用。

三是智能体正成为人工智能落地的应用载体。如果将人工智能的发展与人的成长相比较的话,上游通识高质量数据集相当于中小学的通识教材,通用大模型相当于通识教育阶段的中学生,还不能胜任各行各业的专业工作。中上游的行业高质量通识数据集相当于大学的专业教材,由此训练出的行业大模型类似于本科生,已具备一定专业技能,但还不能胜任具体的专业工作。中下游的行业高质量专识数据集相当于研究生的专业教材,由此训练出的智能体相当于硕士或博士,可以承担各种专业工作。

四是行业高质量数据集供给匮乏制约了AI应用。当前,人工智能发展还处在上游通用大模型阶段,而人工智能的生命力在于其在千行百业的广泛应用,中间还需要走过构建行业高质量通识数据集并建设行业大模型的中上游阶段,以及构建行业高质量专识数据集并建设智能体的中下游阶段。不同于通识高质量数据集由互联网上可流通的公域数据加工处理而来,行业高质量数据集是由行业企业私域数据加工处理形成的,私域数据的高安全性和低流通特性,决定了大模型企业难以获得数据,数据源机构缺乏数据加工能力,造成行业高质量通识数据集和行业高质量专识数据集的供给严重不足,直接影响了行业大模型和智能体的形成和智商水平,制约了人工智能在千行百业的落地应用。

五是高质量数据集的作坊式生产方式效率低下。行业高质量数据集匮乏的另一个核心原因在于生产方式效率低下。当前,高质量数据集生产还处于作坊式生产阶段,类似于农业社会谁要喝水谁家打井,谁要做饭自己劈柴一样,现在谁要训练大模型,谁就自己去构建高质量数据集,一方面不易获取各行业的私域数据,另一方面各家反复重复造轮子,生产效率低下,标准不统一,高质量数据集供给规模受到极大限制。急需创新一种生产新业态,规模化、体系化、设施化地生产高质量数据集。

数据工厂如何壮大

事实上,用一句话来描述数据工厂,那就是“批量原始数据进—规模化高质量数据出”,即数据工厂最根本的功能,就是将海量的原始数据加工成供人工智能使用的高质量数据集。

从当下情况来看,数据工厂是数智社会的一种新型生产业态,在理论、政策、实践等各方面都处于初级探索阶段,其建设模式、运营机制和部署策略已初步形成并处于快速迭代变化中。

张向宏表示,在建设模式方面,数据工厂有数据标注企业迭代、数据存储基地升级、人工智能企业延伸和技术企业创新创立四种建设模式。在运营机制方面,数据工厂已形成保障模式、定制模式、结对子模式、电商模式等四种运营机制。在部署策略方面,数据工厂应与国家数据基础设施协同部署,在国家基础设施底座应部署通识数据集数据工厂,在重要功能设施应部署行业通识数据集数据工厂,在各业务节点应部署行业专识数据集数据工厂等三种部署策略。

谈及未来如何加速推动数据工厂新业态不断发展壮大和成熟完善时,张向宏表示,需要国家、地方、行业、企业等各方协同发力,共同推动。

首先,从国家层面来看,应从政策、标准、技术、平台四方面提供鼓励发展的宽松环境,要加快出台《关于促进数据工厂新业态创新发展的指导意见》,尽快启动数据工厂相关标准研制,抓紧突破数据工厂关键技术瓶颈,持续加强数据工厂支撑平台建设。

其次,从地方和行业层面来看,应从场景选择、模型、数据等三方面,打造行业(区域)应用场景,建设行业(区域)模型工厂,建设行业(区域)数据工厂,形成“数据提升模型、模型驱动场景、场景产生数据”的“数据—模型—场景”的行业(区域)飞轮效应。

最后。从企业层面来看,应从场景选择、智能体、数据等三方面,打造企业人财物产供销各类应用场景,构建企业、业务、流程等各环节的智能体,建设企业数据工厂,形成“数据提升智能体、智能体驱动场景、场景产生数据”的“数据—智能体—场景”的企业飞轮效应。

来源:证券日报

白皮书全文

以下为《数据工厂白皮书》全文:

640-62
640-63
640-65
640-64
640-66
640-67
640-69
640-71
640-68
640-70
640-73
640-72
640-74
640-75
640-77
640-76
640-78
640-80
640-79
640-81
640-82
640-83
640-84
640-85
640-87
640-86
640-88
640-89
640-91
640-90
640-93
640-92
640-94
640-95
640-96
640-98
640-97
640-99
640-100
640-101
640-103
640-102
640-104
640-105
640-107
640-108
640-106
640-110
640-109
640-124
640-111
640-113
640-112
640-126
640-115
640-114
640-116
640-117
640-118
640-119
640-123
640-120
640-121
640-122
640-125
640-127
640-130
640-128
640-129
640-131
640-132
640-133
640-135
640-134
640-136
640-137
640-138
640-140
640-139
640-141
640-142
640-143
640-144
640-145
640-146
640-148
640-148
640-147
640-150
640-149
640-151
640-151
640-151
640-151
640-154
640-152
640-153
640-156
640-155
640-158
640-157
640-159
640-160
640-161
640-162
640-164
640-163
640-166
640-165
640-167
640-169
640-168
640-170
640-174
640-173
640-172
640-171
640-175
640-176
640-177
640-179
640-178
640-180
67cc12040f22785f7b84cd6e889e3cae640-181
640-186
640-185
640-186
640-185
640-186
640-187
640-188
640-189
640-191
640-190
640-192
640-193
640-194


 

 

来源:通信产业报、交大评论、证券日报

www.smartcity.team
【数字科技专题研究】社群
同行深度交流,专注智慧城市与数字科技行业研究、资料沉淀。
持续更新最新行业白皮书、产业研究、政策动态与落地解决方案,帮助行业从业者高效积累知识、共享经验。
海量精华内容持续迭代,提供前沿视野,对接行业人才,开展案例共创与资源互通,共建高质量行业交流氛围。
点击查看>> https://t.zsxq.com/zGWUg

为您推荐

发表回复