国脉研究院邓北美:政务高质量数据集建设路径与实践,为什么建、是什么、怎么建、案例实践,详解五步法与四个关键环节

2026(第三届)新疆数字经济创新发展大会在乌鲁木齐开幕。9月16日上午,在“数据要素价值释放与数智政府建设研讨会”专题会上,国脉研究院智能应用评价中心主任邓北美《政务高质量数据集建设路径与实践》主题演讲,从“为什么建、是什么、怎么建、案例实践”四个方面,系统拆解了政务高质量数据集建设的路径与方法。

640-104

01 从一个最小的事说起:新生儿落户

邓北美主任以一个具体场景开场:新疆新生儿落户,过去需要跑三个部门、耗时20天,如今一窗提交、1.5小时办结。

“这中间没有哪个部门加班加点。真正起作用的,是几个部门的数据围绕‘新生儿出生’这件事重新组织了一遍。”她指出,支撑这一变化的是三件事:数据共享——公安、卫健、医保的数据打通,字段互相调用;流程再造——从“跑三个部门”变成“窗口提交一次材料”;责任机制——一数一源,部门之间敢直接采信对方的数据。

但她同时指出,这三件事解决的是“数据通不通”的问题;“数据好不好用”还没有人管——这正是高质量数据集建设要解决的核心命题。

02 政务高质量数据集为什么非建不可、为什么是现在

邓北美主任用三组数字呈现了当前现状。根据国家数据局2026年8月公开数据显示,全国年度数据生产总量已达52.26ZB,已建成高质量数据集超过12.6万个、规模超过1815PB,数量增长很快。但全国数据资源调查(2025年度)指出工业领域数据留存率仅为2.9%,即便基础最好的工业领域尚且如此,政务数据的沉睡只会更严重。此外,全国年度数据生产总量达52.26ZB,存储总量2.53ZB,活跃数据总量1.67ZB。可见,当前数据总量是充足的,真正短缺的是能够直接用于模型训练、直接解决具体业务问题的“数据集”。从“有数据”迈向“有高质量数据集”,正是当前这一阶段需要完成的核心任务。

随后,邓北美主任梳理了高质量数据集建设政策演进的三步:第一步,解决“数据是不是生产要素”,以“数据二十条”为标志;第二步,解决“政府手里的数据能不能用”,以中办、国办公共数据资源开发利用意见为标志;第三步,解决“数据好不好用、能不能直接给AI用”——随着国家数据局行业高质量数据集建设实施方案与建设指引出台,这一步刚刚起步,也正是当下的机会窗口。

03 什么是政务高质量数据集

国家政策文件中定义:高质量数据集是经过采集、加工等数据处理,可直接用于开发和训练人工智能模型,能有效提升模型性能的数据的集合。“说白了,以前我们建数据(报表、驾驶舱)是给人看的,现在建高质量数据集是给AI用的。这是本质区别。”邓北美主任强调,定义里核心要记住四个字——“直接用于”。

她还划了三条边界,针对的是当前工作中的惯性误区:

高质量数据集不是数据目录——1.3万条目录不等于1.3万个能用的数据集,目录只说明“有什么”,说明不了“能用”;

它不是数据仓库——存得下不等于用得上,归集进库只是把原料搬进了院子,离模型直接调用还差一整条加工线;

它也不是项目交付物——验收签字不等于它真正用起来了,建完没人调用就是闲置资产,数据集的价值从被使用那天才开始。

她强调,判断高质量数据集的标准只有一条有没有具体场景会直接调用它。

04 怎么建:五步法与四个关键环节

邓北美主任提出政务高质量数据集建设的“五步法”:找场景、盘家底、立标准、管质量、优运营。

应先定场景再建数据,立项须满足“一个牵头主体、一个具体场景、一个可衡量效果”;

盘家底要做到一数一源、责任到人,以“数据资源清单”与“数据集需求清单”双向匹配推进;

立标准要统一字段口径、采用国家标准,且标准须在加工前定好;

管质量要静态守底线、动态验价值,引入代表性模型做基准测试,量化回答数据集到底让模型性能提升了多少;

优运营则要把飞轮转起来,通过政府、平台、市场、场景四方协同,实现上架、推送、反馈、整改、迭代整体闭环。

她同时强调,安全合规是横贯全程的门槛,确权授权前置,没有授权依据,加工得再好也出不了域。

640-106

在此基础上,邓北美主任进一步提炼了决定数据集“含金量”的四个关键环节:场景构建,从业务痛点出发识别高价值应用场景,以场景倒推数据集建设需求;一数一源梳理,摸清数据家底,明确每个数据项的唯一来源部门;宽表制作,以业务对象为核心跨部门数据关联融合,形成“全域视图”;数据质量检测,建立完整性、准确性、一致性、时效性四维度质检体系,自动化检测与人工复核相结合。

640-10

0从5000个项目到一个智能体

在实践层面,邓北美主任介绍了国脉互联的实践——最新打造的“场景构建智能体”。这款产品的出发点,是很多政府和企业的真实困境:手里攒了不少数据,却说不清到底能建哪些场景、该从哪儿下手。国脉互联把20余年承接的5000多个政务项目,以及每年年会评选出的优秀案例,都变成了它的“底料”。

第一步·锚定需求:从“有数据、却不知该建什么场景”这一痛点出发,先想清楚产品要帮用户解决什么问题。

第二步·汇聚底料:把国脉互联20余年承接的5000多个政务项目,与每年年会评选出的优秀案例全部纳入,作为后续拆解的底料。

第三步·逐一拆解:把每个项目、每个案例拆开来看——它解决什么问题、取得什么成效、需要什么数据、由哪些部门支撑、又产生什么数据。

第四步·形成数据集:按场景要求把上述要素逐项梳理、重新组织,沉淀为一份份高质量数据集。

第五步·喂养模型:将数据集喂给大模型训练,最终形成“场景构建智能体”。

训练完成后,这个智能体的用法很直接:只要告诉它“你手上有什么数据”,它就能告诉你“可以构建什么样的场景”——把国脉20余年的项目经验,变成政府和企业随手可用的场景参谋。

演讲最后,她用一句话收束:“数据的价值,是在场景里用出来的;锁在机房、停在报表,都不算数。”

640-105

640-107

来源:国脉研究院

www.smartcity.team
【数字科技专题研究】社群
同行深度交流,专注智慧城市与数字科技行业研究、资料沉淀。
持续更新最新行业白皮书、产业研究、政策动态与落地解决方案,帮助行业从业者高效积累知识、共享经验。
海量精华内容持续迭代,提供前沿视野,对接行业人才,开展案例共创与资源互通,共建高质量行业交流氛围。
点击查看>> https://t.zsxq.com/zGWUg

为您推荐

发表回复