数据资产目录怎么编?分类和编码规则
数据资产盘点完了,几十张表的盘点成果摊在那里,接下来编目录。这一步看着简单,做起来坑不少:分类维度定不准,目录编完没人用;编码规则设计粗糙,资产一多就乱;目录的维护没机制,半年后和实际两张皮。
这篇把数据资产目录的编制方法完整过一遍:分类体系怎么设计、编码规则怎么定、目录怎么发布、怎么维护。方法在两个集团客户的项目里验证过,一个数据资产八百多条、一个两千多条,规模不同,方法论一致。下文展开的就是这套方法论,资产量几百条的企业能直接照搬,量级更大的按粒度调整。
一、分类体系:两个维度,别贪多
数据资产目录的分类,常见错误是维度太多:按业务域分、按部门分、按系统分、按数据类型分,四套维度叠在一起,一条资产挂在四个类目下,查的人晕,维护的人烦。
实践结论:主线维度一个,辅助维度一个,够了。
-
主线维度用业务域。业务域是企业语言,业务人员找数据的第一入口是"营销的数据""供应链的数据"。业务域的划分参考企业的价值链:战略决策、营销、研发、生产、供应链、财务、人力、行政,八到十二个一级域,域下再分二级(营销域下分客户、渠道、活动)。域的划分以企业自己的职能架构为锚,别照搬什么国际标准,目录是给自己人用的,自己人的语言就是标准。
-
辅助维度用数据形态。结构化数据(库表)、半结构化(日志、接口报文)、非结构化(文档、图片)。形态维度服务于治理工具的匹配:结构化资产走数据质量工具链,非结构化走内容管理工具链,目录里一眼分清。
部门、系统这类属性不做分类维度,做目录的检索字段:一条资产标注所属部门、所在系统,检索时能过滤就行,不用进分类树。分类树要瘦,检索字段要全,目录的好用来自这个分工。
二、编码规则:身份号怎么编
资产的编码是目录的身份证,设计三条原则:稳定、可读、可扩展。
-
稳定:编码一经分配终身不变,资产的名称可以改、归属可以调,编码不动。稳定性靠编码里不掺易变信息,把部门代码编进资产编码的方案,部门一重组编码全废,这是经典反例。
-
可读:编码里携带最少但够用的语义。推荐结构:域代码加形态码加流水号。域代码两位(YL营销、GY供应链),形态码一位(S结构化、H半结构化、F非结构化),流水号四位。例:YL-S-0003,营销域第三条结构化资产。可读性的价值:看码知域,排查和沟通时省一半解释。
-
可扩展:域代码预留空间(两位字母够两百五十六个域,实际用不到二十个),流水号四位够九千九百九十九条,超了再说。扩展性的另一个层面:编码规则里预留"组"的概念——同类资产的集合(比如同一主题的分表)编组码,组内资产挂组,目录的层级表达力就出来了。
编码分配的纪律:集中分配(目录管理员统一发码,不是各部门自己编)、空号不回收(作废的编码留存不重用,历史引用不悬空)。
三、目录的字段设计:展示和检索分层
目录页面的字段分两层:列表层展示的精华字段、详情层的全量字段。
列表层八个字段:资产编码、资产名称、所属域、数据形态、业务负责人、密级、更新时间、热度标签。热度标签(高频访问、周期访问、休眠)是目录的独有价值——使用者判断"这数据靠不靠谱"的直觉依据。
详情层在列表基础上展开:业务描述、业务负责人和技术负责人的双责任人、存储位置、数据量级、更新频率、下游使用方、关联的制度和标准文档。详情层的字段和资产卡片的字段体系打通,目录是卡片的索引页,点开目录条目跳转资产卡片全貌。
字段设计的一个原则:目录不放技术细节(表结构、字段清单这类),技术细节在数据字典的范畴。目录的读者是业务和管理层,技术细节放了也没人看,还抬高了维护成本。目录管"有什么、谁负责、能不能用",字典管"里面具体是什么",职责切清楚,两边不打架、不抢戏。
四、编制流程:四步走
目录编制的流程四步,顺序不能乱。
-
第一步:定框架。分类体系、编码规则、字段模板三件套评审定稿。评审拉上业务部门的代表——框架是他们要用的,他们的语言习惯定框架的底层。框架定了不再大动,后续的调整走版本化演进。
-
第二步:批量建档。按盘点成果批量导入:编码自动分配,名称和归属从盘点表带入,密级和热度标签首批先空着。批量建档的目标是快——先把目录的骨架搭起来,细节慢慢长肉。
-
第三步:补关键信息。优先补三个字段:业务负责人(逐条落实到人,这是目录活起来的关键)、密级(按分类分级制度批量标注)、业务描述(高质量的描述逐条人工写,写不动的先用系统备注顶着,分批优化)。
-
第四步:发布和推广。目录发布不是发通知了事:目录的使用培训(怎么查、怎么申请权限、怎么反馈纠错)覆盖到主要部门,目录的入口挂到企业门户和OA的显眼位置。推广期收集使用反馈,反馈驱动目录的第一轮优化,用得多的目录才值得维护,冷清的目录先查入口和易用性,再查内容质量。搭贝的数据目录模块自带申请和审批流,目录不只是查的入口,还是数据使用的服务窗口——发布即服务,目录的生命力来自被使用。
五、维护机制:目录是活的
目录编完只是出生,活得靠维护机制。
-
变更触发:资产的变更(新增、退役、负责人调整)挂到变更管理流程,流程终点自动更新目录。人工主动维护的模式撑不过半年,流程驱动才可持续。
-
定期核对:季度核对目录和实际情况的一致性,抽样核对加上系统自动比对(存储位置的实际存在性批量校验),差异清单化整改。
-
热度刷新:访问热度的标签按季度刷新,热度数据来自数据服务网关的访问日志。休眠资产的处置建议(归档、下线)随热度报告输出。
-
年度体检:每年一次目录的全面体检,评估目录的完整率、准确率、使用率,体检报告进数据治理的年度汇报。
维护的责任主体是目录管理员(治理团队的岗位),但内容的及时性靠全员:资产的使用者发现目录信息过期,目录页面的纠错按钮一键反馈,管理员核实更新。纠错反馈的处理时效纳入治理团队的考核——目录的公信力来自反馈有回音,提了三次错没人理的用户,第四次就再也不提了。
常见问题
Q:目录要覆盖非结构化数据吗?
要,但分层覆盖。核心的非结构化资产(制度文档、合同模板、重要的报表文件)进目录,琐碎的(日常邮件、临时文件)不进。非结构化资产的目录粒度到"资产集合"(比如合同模板库一条)而不是到单文件,粒度太细维护不过来。
Q:和主数据管理是什么关系?
两回事但强相关。主数据是"需要跨系统统一的核心实体数据"(客户、物料、供应商),主数据管理管这些数据的唯一性和质量;数据资产目录管"企业有哪些数据资产"的全景索引。主数据本身是目录里的一条资产,目录是主数据的地图——一个管实体,一个管索引,互相引用不互相替代。
Q:编码用系统自动生成还是人工编?
自动生成为主,规则内的人工微调为辅。自动生成保证规则一致和流水有序,特殊资产(历史遗留的有名资产)允许在规则框架内的人工定制(域码形态码照旧,流水号段预留特殊段)。完全人工编码的目录,编码质量随人员变动滑坡。
Q:目录的信息安全怎么管?
分级展示。目录本身按密级控制可见性:公开级的资产全员工可见,内部级登录可见,敏感级仅治理团队和授权人可见。目录的检索日志留痕——谁查过什么资产,审计时能回溯。目录是数据的地图,地图本身也要保密,这个意识不少企业缺——地图公开了,小偷也就知道金库在哪了。
Q:编目录大概要多久?
中型企业(资产千条级)全流程两到三个月:框架两周、批量建档两周、关键信息补全四到六周、发布推广两周。快慢的瓶颈在第三步的业务负责人落实和描述撰写,这两项是人力密集活,没有捷径,投入换来的是目录的可用性——省这两步的目录,发布之日就是荒废之始。
浙公网安备 33010602011771号