数据治理,是穿透式监管体系建设中容易被误解、也容易走弯路的一个领域。
很多人一谈数据治理,就想到数据标准、数据质量、数据血缘、数据资产,然后就开始做数据盘点、建数据标准、搞数据清洗。
这些工作本身没错,但如果做这些工作的目的不清晰,就很容易陷入“为了治理而治理”的困境。
数据标准建了一大堆,质量提了一大截,但规则模型还是跑不起来,预警信号还是出不来。
笔者认为,这出在对“数据治理到底是为了什么”这个根本问题的理解上。
在穿透式监管的语境下,数据治理不是目标,是手段。在其他场合,大概率也是这样的。
数据治理的最核心目的,是让规则模型跑起来,让特定和指定的风险从“人防”变成“技防”。
01 对数据治理本质的追问:手段还是目标
在讨论穿透式监管的数据治理之前,需要回答一个问题:数据治理,到底是目标,还是手段?
1. 如果认为数据治理是目标,那么工作就会围绕“数据本身”展开。
工作完成了,指标达标了,数据治理就算成功了。至于这些数据用来干什么、能不能支撑业务、能不能跑模型,那是别人的事。
2. 如果认为数据治理是手段,那么工作就会围绕“数据要支撑什么”展开。
规则模型需要什么数据内容,就优先治理数据内容;预警信号需要什么数据质量,就优先提升什么数据质量;业务系统需要什么数据贯通,就优先贯通什么数据。
也就是,数据治理的成效,不是看标准建了多少、质量提升了多少,而是看规则模型能不能跑起来,跑得好不好、预警信号准不准。
正如DAMA国际数据管理协会对数据治理的定义——“对数据资产管理行使权力和控制的活动集合”。
在这个定义中,“行使权力和控制”是动作,“数据资产”是对象,动作的对象不是目的。
DAMA提出的另一个原则:“数据治理需要服务于企业的战略与商业过程”,进一步说明数据治理是为业务目标服务的。它本身不是终点。
如把数据治理当作目标,就会陷入“为治理而治理”的困境。投入大量资源做数据工作,但业务价值不明显,模型还是跑不起来,预警还是不准确。
把数据治理当作手段,就会始终围绕“数据要支撑什么”来开展工作。必须先搞清楚要跑什么模型、监控什么风险、产生什么预警,再倒推需要什么数据、什么质量、什么标准。
可以说,穿透式监管下的数据治理,其真正的涵义是“为规则模型运行而进行的数据准备与持续保障工作”。
它的目标是让规则模型能够准确、稳定、持续地运行,让特定风险从“人防”变成“技防”。
这里的关键词不是“数据”,而是“为规则模型运行”。离开了规则模型,离开了“技防”的目标,数据治理就失去了方向。
即,穿透式监管下的数据治理,目标不是“把数据管好”,而是“把风险管住”。
数据治理的成效,最终要体现在规则模型的命中率、准确率、预警的及时性、处置的有效性上,而不是数据标准的数量、数据质量的评分等。
02 穿透式监管数据治理的开展路径
理解了数据治理是手段、是为规则模型运行服务的之后,接下来的问题是:如何开展穿透式监管下的数据治理?
(一)模型运行需要什么,数据就治理什么
穿透式监管的规则模型,每一类都有其特定的数据需求。
投资决策合规性校验模型需要决策日期、出资日期、审批层级、投资金额等,没有这些数据,模型就无法判断“先投后批”是否发生。
围标串标识别模型需要投标人信息、IP地址、MAC地址、投标文件、股权关联关系,没有这些数据,模型就无法识别“不同投标人由同一台电脑制作投标文件”。
关联交易合规性监测模型需要交易对手信息、关联方清单、交易金额、定价依据,没有这些数据,模型就无法判断“关联交易是否超限”。
数据治理的工作,就是精准满足这些需求,确保模型所需的每一个数据字段都“可获得、可读取、可信任”。
“可获得”是指数据存在于某个业务系统中,能够被采集到数据平台。如果一个规则模型需要的数据根本不存在于任何系统中,那就不是数据治理能解决的问题,而是业务流程本身需要补录数据。这种情况下,需要通过制度规定新增数据采集节点,而不是通过技术手段“治理”出数据。
“可读取”是指数据能够通过接口、数据库连接、文件传输等方式被规则引擎获取。如果一个数据字段存在于业务系统中,但系统不开放接口、数据格式无法解析、字段定义不清晰,数据就无法被读取,模型就无法运行。
“可信任”是指数据的准确性、完整性、及时性能够满足模型运行的要求。如果一个数据字段存在但质量不可靠,如缺失率高、错误多、更新滞后——模型就可能漏报或误报。
对每一个模型所需的每一个数据字段,需要确认它是否存在(可获得)、能否被读取(可读取)、质量是否可靠(可信任)。
如果有缺口,就补缺口;如果有质量问题,就提质量。这才是真正的数据治理。
(二)规则先行、数据按需、迭代倒逼
明确了这个逻辑之后,穿透式监管数据治理的开展路径就清晰了。
它遵循一个“规则先行、数据按需、迭代倒逼”的逆向逻辑。
第一步是规则先行。先梳理清楚要监控什么风险、设计什么规则、运行什么模型。没有规则,就不知道需要什么数据。
这一步的工作内容是完成规则模型的六要素设计,特别是“数据来源”这个要素。明确每个判断变量需要哪个系统、哪个表、哪个字段的数据。
第二步是数据按需。规则明确之后,逐条确认每个数据字段的现状。确认它是否存在,如果不存在,是业务系统缺失还是从未采集,解决方案是推动系统改造还是新增填报节点;确认它能否被读取,如果不能,是接口未开发、数据格式不兼容还是访问权限未开放,解决方案是开发接口、统一格式还是申请权限;确认它的质量是否可靠,如果不可靠,是完整性不足、准确性存疑还是及时性不够,解决方案是补录历史数据、建立质量监控规则还是优化采集频率。
第三步是迭代倒逼。数据治理不是一次性的,也不是在模型上线前“全部做完”的。模型上线运行后,会暴露数据质量问题——某个字段缺失率高、某个接口不稳定、某个数据源更新滞后。这些问题,在模型设计阶段可能未被发现,或者在数据治理阶段被认为“可以接受”。但一旦模型运行起来,预警信号不准、误报率高,数据质量问题就会被放大,倒逼数据治理迭代优化。
(三)实务中的三个优先原则
在实践中,数据治理往往工作量大、周期长、资源有限。以下三个优先原则可帮助企业在有限资源下做出合理取舍。
1. 业务价值优先。先治理对高风险领域、核心业务、关键规则模型至关重要的数据,再治理辅助性数据。资金数据、投资决策数据、重大合同数据,优先级高于行政后勤数据。
2. 数据条件优先。先治理已经存在、只需要“打通”或“清洗”的数据,再治理需要从无到有“建设”的数据。如果一个数据字段已经存在于某业务系统中,只是接口未开发,治理难度低、见效快,优先级高。如果一个数据字段根本不存在于任何系统中,需要先推动业务系统改造或新增填报节点,治理难度高、周期长,优先级可适当后移。
3. 模型就绪优先。先治理即将上线的模型所需的数据,再治理远期模型所需的数据。第一批规则模型需要什么数据,就优先治理什么数据。第二批、第三批模型的数据需要,可以在模型设计完成后、上线之前陆续完成。
03 穿透式监管数据治理的扩展
穿透式监管下的数据治理,除了跑模型,还有其他别的目的吗?
有。但这些目的,都要和“让数据支撑管理”这个本质相吻合。
1. 扩展一:支撑其他风控模型的运行
穿透式监管规则模型只是企业风控模型体系的一部分。企业可能已经有财务风险预警模型、资金风险监测模型、信用风险评级模型等。
穿透式监管的数据治理工作,其建设成果,如统一的数据标准、贯通的数据链路、可靠的数据质量,是可以同时支撑这些模型的运行。一个数据字段,是既能服务于穿透式监管的围标串标识别模型,也能服务于采购管理的价格异常监测模型的。
数据治理的成果,具有复用价值,一次治理、多次使用。
2. 扩展二:支撑业务系统的有效运行
业务系统在运行过程中,本身就需要数据的支撑。合同管理系统的标准合同文本,需要完整的客商数据,采购管理系统的招标流程,需要完整的供应商数据,财务系统的付款审批,需要完整的合同数据。
通过建立数据的“统一标尺”,消除语义与格式壁垒,确保数据使用和交换的一致性和准确性,加强数据源头治理,提升了这些基础数据的质量和贯通程度,改善了业务系统的运行效率和合规水平。
扩展三:支撑数据驱动的监管分析
规则模型产生的是“预警信号”,系统自动发现异常、自动推送。但预警信号之外,还有大量的监管分析工作需要人来做:某个领域风险趋势如何、哪些子企业风险最集中、哪些制度条款执行最薄弱。
这些分析工作也是建立在完整、准确、及时的数据基础之上。数据治理为这些分析提供了可信的数据源——不是靠人工填报的汇总数据,而是从业务系统自动采集的原始数据。
扩展四:支撑监管报送的自动化
国资委要求的数据报送,包括产权数据、投资数据、财务数据、资金数据等,目前仍以人工填报为主。
数据治理的深化,可以让这些报送数据从源头系统自动采集、自动校验、自动生成报送文件,大幅减少人工填报的工作量和出错概率。
2号文明确要求构建“五自动”智能化监管闭环——数据自动采集、模型自动分析、风险自动预警、核查自动派单、整改自动跟踪。
扩展五:支撑数据资产的沉淀与复用
数据治理的过程中,企业会建立起统一的主数据标准、清晰的数据血缘关系、可靠的数据质量体系。这些成果本身就是企业重要的数据资产,可以在未来的数据分析、业务创新、管理优化中持续复用。
跑模型是数据治理最直接、最紧迫的目标。规则模型上线运行是穿透式监管的“硬要求”,等不了、拖不得。
支撑其他风控模型运行,是企业数据治理工作的自然延伸。同一个数据底座可以服务多个风控场景。
支撑业务系统合规运行,是数据治理对业务管理的直接贡献,数据质量提升了,业务系统运行更规范了。支撑监管分析自动化,是数据治理从“被动响应”走向“主动服务”的标志。不只是“按需取数”,而是“有数可用、用数可析”。
这五个扩展是递进的:先让规则模型跑起来,是基础;再让更多风控模型用起来,这是再扩容;然后让业务系统合规起来、监管分析自动起来,这是深化;最后让数据资产沉淀下来,这是持续。
但无论扩展到什么程度,都不能忘记一个基本事实:穿透式监管的数据治理,不是为治理而治理,而是为管控而治理。
数据标准建得再好,如果规则模型跑不起来,就是失败的。数据质量提得再高,如果预警信号不准确,就是无效的。数据血缘画得再清,如果管不住风险,就是没有价值的。
数据治理的一切工作,都必须回到“让风险看得清、管得住”这个终极目标上来。
小结一下:穿透式监管的数据治理,最核心的认知是:数据治理是手段,不是目标。作为手段,数据治理是让规则模型跑起来,让特定风险从“人防”变成“技防”。数据治理同时是伴随穿透式监管体系全生命周期的持续工作,不是一次性的“项目交付”。无论如何,数据本身不是目的,数据支撑的管控能力才是目的。