一、国企数据治理从哪入手?体系建设实操指南
数据治理在国企里到底是什么处境:
国企数据治理从哪入手?不是买工具,不是建大屏,而是先把数据资产清单和责任矩阵两张表做出来——资产清单回答"有哪些数据",责任矩阵回答"谁负责这些数据的质量"。这话不好听,但是事实。数据治理本身投入大、见效慢,业务部门感受不到直接价值,推起来阻力重重。
国资委推行穿透式监管之后,要求企业定期上报各类经营数据。数据质量不行,报上去的数字对不上,被退回来重新整理,反反复复。领导一拍桌子:搞数据治理!
然后就开始买工具、请咨询、建团队。但很多人搞着搞着就迷茫了——数据治理到底治理什么?怎么治理?治理到什么程度算合格?
这篇文章是我这两年实操经验的总结,不讲理论框架,就讲怎么落地。
第一步不是买工具,是摸清数据现状:
我见过太多国企的数据治理项目,第一步就是买一套数据治理平台,花了几百万。买完发现不知道拿它治理什么。
正确的第一步是做数据资产盘点。说白了就是搞清楚:你有哪些数据,这些数据存在哪里,质量怎么样,谁在用。
盘点工作的实操方法:
按系统盘点:
把企业内所有信息系统列出来——ERP、OA、HR、财务、MES、CRM、WMS……每个系统里有哪些核心数据表,每张表有多少数据量,数据更新频率是多少。
按业务域盘点:
把数据按业务领域分类——客户域、供应商域、物料域、财务域、人力域、生产域。每个业务域的主数据有哪些,交易数据有哪些,统计分析数据有哪些。
抽样检查数据质量:
从每个系统里抽出几百条数据,人工看一下。字段缺失率多少?重复记录多少?格式是否统一?异常值有没有?
盘点的产出物是一份《数据资产目录》和一份《数据质量问题清单》。这两份文档是后面所有治理工作的起点。
主数据管理:数据治理的核心战场:
国企数据治理最重要的一个领域就是主数据。主数据是跨系统共享的、描述企业核心业务实体的数据——客户、供应商、物料、组织、人员。
为什么主数据这么重要?因为它被多个系统使用。如果ERP里的客户编码和CRM里的客户编码不一致,做数据分析的时候就没法关联。国资监管数据报送的时候,数据口径不统一就会导致报表数字打架。
主数据管理要做这几件事:
制定编码规则:
每一类主数据都要有统一的编码规则。比如客户编码用"KH+8位流水号",供应商编码用"GYS+8位流水号",物料编码按"大类中类小类+流水号"。
建立数据模型:
每一类主数据包含哪些属性?每个属性的定义、类型、长度、是否必填、校验规则是什么?这些定义要文档化,形成数据标准。
数据清洗和映射:
历史数据怎么办?不同系统里的同一实体(比如ERP里的客户A和CRM里的客户A)要建立映射关系。清洗掉重复数据、纠正错误数据、补齐缺失数据。
看一下主数据清洗的核心逻辑:
import pandas as pd
# 客户数据清洗示例
def clean_customer_data():
# 从不同系统导出客户数据
erp_customers = pd.read_excel('erp_customers.xlsx')
crm_customers = pd.read_excel('crm_customers.xlsx')
# 统一字段名
erp_customers = erp_customers.rename(columns={
'khmc': 'customer_name',
'khdh': 'customer_phone',
'khdz': 'customer_address',
'shxydm': 'credit_code'
})
crm_customers = crm_customers.rename(columns={
'client_name': 'customer_name',
'contact_phone': 'customer_phone',
'addr': 'customer_address',
'uni_credit_no': 'credit_code'
})
# 以统一社会信用代码为主键做去重合并
merged = pd.merge(
erp_customers, crm_customers,
on='credit_code', how='outer',
suffixes=('_erp', '_crm')
)
# 数据冲突时优先取非空值
merged['customer_name'] = merged['customer_name_erp'].fillna(merged['customer_name_crm'])
merged['customer_phone'] = merged['customer_phone_erp'].fillna(merged['customer_phone_crm'])
# 统一分配新编码
merged['new_customer_code'] = ['KH' + str(10000001 + i).zfill(8) for i in range(len(merged))]
# 生成清洗报告
report = {
'总记录数': len(merged),
'ERP记录数': len(erp_customers),
'CRM记录数': len(crm_customers),
'重复记录数': merged['credit_code'].duplicated().sum(),
'名称缺失数': merged['customer_name'].isna().sum(),
'电话缺失数': merged['customer_phone'].isna().sum()
}
print('清洗报告:')
for k, v in report.items():
print(f' {k}: {v}')
merged.to_excel('cleaned_customers.xlsx', index=False)
return merged
三、元数据管理:给数据贴标签
元数据就是"描述数据的数据"。比如"客户名称"这个字段——它的业务含义是什么?是企业的全称还是简称?最大长度多少?什么编码格式?谁负责维护?
国企系统多,每个系统对同一个概念有不同的叫法和定义。元数据管理的目标就是把这些定义统一管理起来,让所有人看到"客户名称"时,理解是一致的。
元数据管理不需要搞得很复杂。先用Excel维护一份数据字典,包含:字段名、中文含义、数据类型、长度、枚举值、业务规则、归属系统、维护责任人。
等数据治理成熟度提升了,再上专业的元数据管理平台。别一上来就买平台,工具解决不了"字段定义是什么"这种业务问题。
数据质量管理:从被动应对到主动防控:
数据质量管理分两层:事前预防和事后检查。
事前预防: 在数据录入环节就设置校验规则。比如统一社会信用代码必须是18位、手机号必须是11位数字、金额字段不能为负数。搭贝AI低代码平台这类工具在表单设计时就支持字段校验规则,输入不合法的数据直接拦截。
事后检查: 定期跑数据质量巡检脚本,检查以下几类问题:
- 完整性:必填字段是否有空值
- 唯一性:应该唯一的字段是否有重复
- 一致性:同一实体在不同系统中的数据是否一致
- 准确性:数据值是否在合理范围内(比如企业成立日期不能在未来)
- 时效性:数据是否及时更新(比如供应商联系人电话三年没改过,大概率失效了)
巡检结果生成数据质量报告,按系统、按业务域、按问题类型统计,发给各系统的数据责任人限期整改。
二、主数据管理系统怎么建
如果你们国企要建一套主数据管理系统(MDM),建议分阶段来。
第一阶段:
先做最需要统一的1-2类主数据。我建议从组织架构和人员开始,因为这两类数据的变动频率低,见效快。
第二阶段:
扩展到客户和供应商。这两类主数据涉及的业务系统多,映射关系复杂,需要更多时间。
第三阶段:
物料主数据。物料编码是最头疼的,尤其是制造业国企,物料种类动辄几万到几十万种。
主数据管理系统的核心功能:
- 主数据的创建、修改、审批流程
- 编码自动生成
- 跨系统的数据分发(主数据变更后同步到所有相关系统)
- 数据质量监控
- 变更历史追溯
如果你不想从零开发,用搭贝AI低代码平台搭建MDM是一个性价比很高的选择。数据模型、审批流程、数据分发webhook、变更日志,这些功能低代码平台都能覆盖。
数据治理需要什么组织保障:
技术和工具是次要的,组织保障才是决定数据治理成败的关键。
数据治理委员会:
由企业一把手或者分管IT的副总牵头,各部门负责人参与。负责审批数据标准、协调跨部门的数据争议。
数据管理员:
每个业务部门指定一名数据管理员(可以兼职),负责本部门数据的质量监控、问题反馈和标准执行。
数据治理专职团队:
2-3人的专职团队,负责数据标准的制定、主数据系统的运维、数据质量巡检和报告。
没有这三层组织保障,数据治理项目做半年就会不了了之。
补充几点实操中的经验,可能对刚接手这类项目的人有帮助。
跨部门协作是最容易被低估的难点。技术上说清楚怎么做一个下午就够了,但实际落地时每个部门都有自己的习惯格式和业务口径。我们为了统一一个编码规则开了五次协调会,最后靠分管领导确认才定下来。所以立项阶段就要把跨部门的沟通机制和决策机制设计好,别等到冲突了再临时协调。
选型的时候要看长远。以低代码平台为例,最初只考虑能不能快速搭表单和流程,用了半年发现跨应用的数据关联、统一权限管理这些高级需求冒出来了。好在低代码平台些功能都支持,但如果选型时没考虑这些,到这个阶段就要换平台,代价很大。
安全合规一定要在项目启动阶段就纳入规划,不能等系统建好了再补。数据分类分级、权限矩阵、操作审计、定期评估,这四件事一个都不能少。
投入产出要看全貌。直接成本确实不少,但间接收益——减少返工、节省人力、数据辅助决策——算进去的话投入产出比相当可观。我们第一年基本就回本了。
再聊聊技术层面的几个细节。
部署架构方面,如果系统要对接多个上级平台,建议在前置机和业务系统之间加一层消息队列。我们用的是RabbitMQ,把上报任务异步化,这样即使上级平台接口响应慢或者临时不可用,数据也不会丢,消息堆积在队列里等接口恢复后自动重试。
日志和监控要提前规划好。关键操作——数据生成、转换、签名、上报、反馈——每一步都要有结构化日志。我们用ELK收集日志,在低代码平台搭了个监控看板,实时显示报送成功率、失败原因分布、接口响应时间。出了问题一眼就能定位到哪个环节。
版本迭代方面,国资监管的数据报送标准不是一成不变的,几乎每年都有新的字段或者格式调整。系统设计时一定要做好字段映射的可配置化,最好做到改映射不用改代码,在配置界面调整一下就能生效。这点看起来是小事,但每次标准变更能省两三天的开发时间。
常见问题解答
Q:数据治理需要多长时间才能见效?
如果聚焦在主数据管理和数据质量巡检上,3-6个月可以见到初步效果——至少数据编码统一了、明显的数据质量问题被发现了。要建立比较完善的数据治理体系,通常需要1-2年的持续投入。
Q:数据治理需要多少预算?
取决于你用什么工具。买专业数据治理平台(比如亿信华辰、普元),软件费用几十万到上百万。如果用低代码平台搭,工具成本很低,但需要投入人力。建议先从低成本方案起步,验证效果后再决定是否加大投入。
Q:国资委的数据报送和数据治理是什么关系?
数据治理是基础,数据报送是应用。你不做数据治理,报送的数据质量就没保障。国资委要求的穿透式监管数据采集,核心挑战就是数据口径统一和质量可控。做好数据治理,报送就水到渠成了。
Q:如何让业务部门积极参与数据治理?
抓住业务部门的痛点。比如销售部门抱怨"客户信息各个系统对不上,影响回款"——这就是切入点,用数据治理解决这个痛点,让业务部门看到价值。不要一上来就讲"数据治理体系",业务部门不关心体系,关心的是能不能解决实际问题。
浙公网安备 33010602011771号