第6章 - 数据工程
6.1 数据采集和预处理
6.1.1 数据采集
数据采集又称数据收集,是指根据用户需要收集相关数据的过程。
1、采集的数据类型
结构化数据:是以关系型数据库表管理的数据半结构化数据:是指非关系模型的、有基本固定结构模式的数据,例如日志文件、XML 文档、E-mail 等非结构化数据:是指没有固定模式的数据,如所有格式的办公文档、文本、图片、HTML、各类报表、图像和音频/视频信息等
2、数据采集的方法
传感器采集:通过传感器感知相应的信息,并将这些信息按一定规律变换成电信号或其他所需的信息输出,从而获取相关数据,是目前应用非常广泛的一种采集方式系统日志采集:是通过平台系统读取、收集日志文件变化。系统日志记录系统中硬件、软件和系统运行情况及问题的信息。系统日志一般为流式数据,数据量非常庞大网络采集:是指通过互联网公开采集接口或者网络爬虫等方式从互联网或特定网络上获取大量数据信息的方式。根据系统结构和实现技术,网络爬虫可分为通用网络爬虫、聚焦网络爬虫、增量式网络爬虫、深层网络爬虫等类型其他数据采集:如通过与数据服务商合作,使用特定数据采集方式获取数据
6.1.2 数据预处理
数据的预处理一般采用数据清洗的方法来实现。数据预处理是一个去除数据集重复记录,发现并纠正数据错误,并将数据转换成符合标准的过程,从而使数据实现准确性、完整性、一致性、唯一性、适时性、有效性等。一般来说,数据预处理主要包括数据分析、数据检测和数据修正 3 个步骤。
数据分析:是指从数据中发现控制数据的一般规则,比如字段域、业务规则等。通过对数据的分析,定义出数据清理的规则,并选择合适的算法数据检测:是指根据预定义的清理规则及相关数据清理算法,检测数据是否正确,比如是否满足字段域、业务规则等,或检测记录是否重复数据修正:是指手工或自动地修正检测到的错误数据或重复的记录等
6.1.3 数据预处理方法
进行预处理的数据主要包括数据缺失、数据异常、数据不一致、数据重复、数据格式不符等情况,针对不同问题需要采用不同的数据处理方法。
- 1、
缺失数据的预处理:数据缺失产生的原因主要分为环境原因和人为原因,需要针对不同的原因采取不同的数据预处理方法。删除缺失值:是最常见的、简单有效的方法,当样本数很多的时候,并且出现缺失值的样本占整个样本的比例相对较小时,可以将有缺失值的样本直接丢弃均值填补法:根据缺失值的属性相关系数最大的那个属性把数据分成几个组,再分别计算每个组的均值,用均值代替缺失数值热卡填补法:通过在数据库中找到一个与包含缺失值变量最相似的对象,然后采用相似对象的值进行数据填充- 其他方法:最近距离决定填补法、回归填补法、多重填补法、K - 最近邻法、有序最近邻法、基于贝叶斯的方法等
- 2、
异常数据的预处理:对于异常数据或有噪声的数据,如超过明确取值范围的数据、离群点数据,可以采用分箱法和回归法来进行处理。分箱法:通过考察数据的 “近邻”(即周围的值)来平滑处理有序的数据值,这些有序的值被分布到一些 “桶” 或 “箱” 中,进行局部光滑。一般而言,宽度越大数据预处理的效果越好回归法:一个函数拟合数据来光滑数据,消除噪声。线性回归涉及找出拟合两个属性(或变量)的 “最佳” 直线,使得一个属性能够预测另一个。多线性回归是线性回归的扩展,它涉及多于两个属性,并且数据拟合到一个多维面
- 3、
不一致数据的预处理- 不一致数据是指具有
逻辑错误或者数据类型不一致的数据,如年龄与生日数据不符。这一类数据的清洗可以使用人工修改,也可以借助工具来找到违反限制的数据,如知道数据的函数依赖关系,可以通过函数关系修改属性值。但是大部分的不一致情况都需要进行数据变换,即定义一系列的变换纠正数据,有一些商业工具可以提供数据变换的功能,例如数据迁移工具和 ETL 工具等。
- 不一致数据是指具有
- 4、
重复数据的预处理- 数据本身存在的或数据清洗后可能会产生的重复值。重复值的存在会影响后续模型训练的质量,造成计算及存储浪费。去除重复值的操作一般最后进行,可以
使用 Excel、VBA (Visual Basic 宏语言)、Python 等工具处理。
- 数据本身存在的或数据清洗后可能会产生的重复值。重复值的存在会影响后续模型训练的质量,造成计算及存储浪费。去除重复值的操作一般最后进行,可以
- 5、
格式不符数据的预处理- 一般人工收集或者应用系统用户填写的数据,容易存在格式问题。一般需要
将不同类型的数据内容清洗成统一类型的文件和统一格式,如将 TXT、CSV、Excel、HTML 以及 PDF 清洗成统一的 Excel 文件,将显示不一致的时间、日期、数值或者内容中有空格、单引号、双引号等情况进行格式的统一调整。
- 一般人工收集或者应用系统用户填写的数据,容易存在格式问题。一般需要
6.2 数据存储及管理
6.2.1 数据存储
1、数据存储介质
数据存储首先要解决的是存储介质的问题。存储介质是数据存储的载体,是数据存储的基础。存储介质并不是越贵越好、越先进越好,要根据不同的应用环境,合理选择存储介质。存储介质的类型主要有磁带、光盘、磁盘、内存、闪存、云存储等。
2、存储形式
一般而言,主要有 3 种形式来记录和存储数据,分别是文件存储、块存储和对象存储。
文件存储:文件存储也称为文件级或基于文件的存储,是一种用于组织和存储数据的分层存储方法。换言之,数据存储在文件中,文件被组织在文件夹中,文件夹则被组织在目录和子目录的层次结构下块存储:块存储有时也称为块级存储,是一种用于将数据存储成块的技术。这些块随后作为单独的部分存储,每个部分都有唯一的标识符。对于需要快速、高效和可靠地进行数据传输的计算场景,开发人员一般倾向于使用块存储对象存储:对象存储通常称为基于对象的存储,是一种用于处理大量非结构化数据的数据存储架构。这些数据无法轻易组织到具有行和列的传统关系数据库中,或不符合其要求,如电子邮件、视频、照片、网页、音频文件、传感器数据以及其他类型的媒体和 Web 内容 (文本或非文本)
3、存储管理
资源调度管理:资源调度管理的功能主要是添加或删除存储节点,编辑存储节点的信息,设定某些类型存储资源属于某个节点,或者设定这些资源比较均衡地存储到节点上。它包含存储控制、拓扑配置以及各种网络设备 (如集线器、交换机、路由器和网桥等) 的故障隔离存储资源管理:存储资源管理是一类应用程序,它们管理和监控物理和逻辑层次上的存储资源,从而简化资源管理,提高数据的可用性。被管理的资源主要是存储硬件,如 RAID、磁带以及光盘库。存储资源管理不仅包括监控存储系统的状况、可用性、性能以及配置情况,还包括容量和配置管理以及事件报警等,从而提供优化策略负载均衡管理:负载均衡是为了避免存储资源由于资源类型、服务器访问频率和时间不均衡造成浪费或形成系统瓶颈而平衡负载的技术安全管理:存储系统的安全主要是防止恶意用户攻击系统或窃取数据。系统攻击大致分为两类:一类以扰乱服务器正常工作为目的,如拒绝服务 (DoS) 攻击、勒索病毒攻击等;另一类以入侵或破坏服务器为目的,如窃取数据、修改网页等
6.2.2 数据归档
数据归档是将不活跃的 “冷” 数据从可立即访问的存储介质迁移到查询性能较低、低成本、大容量的存储介质中,这一过程是可逆的,即归档的数据可以恢复到原存储介质中。数据归档策略需要与业务策略、分区策略保持一致,以确保最需要数据的可用性和系统的高性能。
在开展数据归档活动时,有以下 3 点值得注意:
- 数据归档一般只在业务低峰期执行。因为数据归档过程需要不断地读写生产数据库,这个过程将会大量使用网络,会对线上业务造成压力。
- 数据归档之后,将会删除生产数据库的数据,将会造成数据空洞,即表空间并未及时释放,若长时间没有新的数据填充,会造成空间浪费的情况。
- 如果数据归档影响了线上业务,一定要及时止损,结束数据归档,进行问题复盘,及时找到问题和解决方案。
6.2.3 数据备份
1、备份结构
DAS 备份结构:最简单的备份结构就是将备份设备 (RAID 或磁带库) 直接连接到备份服务器上。DAS 各备份结构往往适合数据量不大、操作系统类型单一、服务器数量有限的情况基于 LAN 的备份结构:基于 LAN 的备份结构是一种 C/S 模型,多个服务器或客户端通过局域网共享备份系统。这种结构在小型的网络环境中较为常见,用户通过备份服务器将数据备份到 RAID 或磁带机上。与 DAS 备份结构相比,这种结构最主要的优点是用户可以通过 LAN 共享备份设备,并且可以对备份工作进行集中管理。缺点是备份数据流通过 LAN 到达备份服务器,这样就和业务数据流混合在一起,会占用网络资源LAN-FREE 备份结构:为了克服基于 LAN 备份结构的缺点,该结构将备份数据流和业务数据流分开,业务数据流主要通过业务网络进行传输,而备份数据流通过 SAN 进行传输。其主要缺点是由于备份数据流要经过应用服务器,因此会影响应用服务器提供正常的服务SERVER-FREE 备份结构:SERVER-FREE 备份结构是 LAN-FREE 备份结构的改进。它不依赖应用服务器,而是通过第三方备份代理直接将数据从应用服务器的存储设备传送到备份设备上。第三方备份代理是一种软、硬结合的智能设备,使用网络数据管理协议 (NDMP) 发送命令,从需要备份的应用服务器上获得需要备份数据的信息,然后通过 SAN 直接从应用服务器的存储设备将需要备份的数据读出,再存储到备份设备上
2、备份策略
备份策略是指确定需要备份的内容、备份时间和备份方式。主要有 3 种备份策略:完全备份、差分备份和增量备份。
完全备份(Full Backup):每次都对需要进行备份的数据进行全备份。当数据丢失时,用完全备份下来的数据进行恢复即可。这种备份主要有两个缺点:一是由于每次都对数据进行全备份,会占用较多的服务器、网络等资源;二是在备份数据中有大量的数据是重复的,对备份介质资源的消耗往往也较大差分备份(Differential Backup):每次所备份的数据只是相对上一次完全备份之后发生变化的数据。与完全备份相比,差分备份所需时间短,而且节省了存储空间。另外,差分备份的数据恢复很方便,管理员只需两份备份数据,如星期日的完全备份数据和故障发生前一天的差分备份数据,就能对系统数据进行恢复增量备份(Incremental Backup):每次所备份的数据只是相对于上一次备份后改变的数据。这种备份策略没有重复的备份数据,节省了备份数据存储空间,缩短了备份的时间,但是当进行数据恢复时就会比较复杂。如果其中有一个增量备份数据出现问题,那么后面的数据也就无法恢复了。因此增量备份的可靠性没有完全备份和差分备份高
6.2.4 数据容灾
数据备份是数据容灾的基础。
从技术上看,衡量容灾系统有两个主要指标
RPO(Recovery Point Object,恢复点目标):代表了当灾难发生时允许丢失的数据量。RTO(Recovery Time Object,恢复时间目标):代表了系统恢复的时间。
数据容灾的关键技术主要包括远程镜像技术和快照技术。
远程镜像技术:远程镜像技术是在主数据中心和备份中心之间进行数据备份时用到的远程复制技术。按主从镜像所处的位置分为本地镜像和远程镜像。本地镜像的主从镜像处于同一个 RAID 中,而远程镜像的主从镜像通常分布在城域网或广域网中。由于远程镜像在远程维护数据的镜像,因此在灾难发生时,存储在异地的数据不会受到影响。快照技术:所谓快照,就是关于指定数据集合的一个完全可用的复制,该复制是相应数据在某个时间点 (复制开始的时间点) 的映像。快照的作用有两个:- ① 能够进行在线数据恢复,可以将数据恢复成快照产生时间点时的状态;
- ② 为用户提供另外一个数据访问通道,比如在原数据在线运行时,利用快照数据进行其他系统的测试、应用开发验证、数据分析、数据模型训练等。
6.3 数据治理和建模
数据治理是开展数据价值化活动的基础,关注对数字要素的管控能力,覆盖组织对数据相关活动的统筹、评估、指导和监督等工作,需要重点关注元数据、数据标准化、数据质量、数据模型和数据建模等方面的内容。
6.3.1 元数据
元数据是关于数据的数据 (Data About Data)。其实质是用于描述信息资源或数据的内容、覆盖范围、质量、管理方式、数据的所有者、数据的提供方式等有关的信息。如 这个表格 的 创建时间、创建人、修改时间、文件大小、存储位置等
- 信息对象:元数据描述的对象可以是单一的全文、目录、图像、数值型数据以及多媒体 (声音、动态图像) 等,也可以是多个单一数据资源组成的资源集合,或是这些资源的生产、加工、使用、管理、技术处理、保存等过程及其过程中产生的参数的描述等。
- 元数据体系:根据信息对象从产生到服务的生命周期中,元数据描述和管理内容的不同以及元数据作用的不同,可以将元数据分为多种类型,从最基本的资源内容描述元数据开始,到指导描述元数据的元元数据,形成了一个层次分明、结构开放的元数据体系。
6.3.2 数据标准化
数据标准化的主要内容包括元数据标准化、数据元标准化、数据模式标准化和数据分类与编码标准化。二维表中每一个单元格都是一个数据元,如表格中身份证号的约束;数据模式标准化值是数据表结构、表之间关系标准化,如数据表中有那些字段、主外键约束;
数据标准化阶段的具体过程包括确定数据需求、制定数据标准、批准数据标准和实施数据标准。
确定数据需求:本阶段将产生数据需求及相关的元数据、域值等文件。在确定数据需求时应考虑现行法规、政策,以及现行的数据标准制定数据标准:本阶段要处理 “确定数据需求” 阶段提出的数据需求。如果现有的数据标准不能满足该数据需求,可以建议制定新的数据标准,也可建议修改或者封存已有的数据标准。推荐的、新的或修改的数据标准记录在数据字典中。这个阶段将产生供审查和批准的成套建议批准数据标准:本阶段的数据管理机构对提交的数据标准建议、现行数据标准的修改或封存建议进行审查。一经批准,该数据标准将扩充或修改数据模型实施数据标准:本阶段涉及在各信息系统中实施和改进已批准的数据标准
6.3.3 数据质量
衡量数据质量的指标体系包括完整性、规范性、一致性、准确性、唯一性、及时性等。数据质量是一个广义的概念,是数据产品满足指标、状态和要求能力的特征总和。
- 数据质量描述:数据质量可以通过数据质量元素来描述,数据质量元素分为
数据质量定量元素和数据质量非定量元素。 - 数据质量评价过程:是产生和报告数据质量结果的一系列步骤。
- 第一步:确定适用的数据质量定量元素及数据质量范围
- 第二步:确定数据质量度量方法
- 第三步:选择并使用数据质量评价方法
- 第四步:确定数据质量结果,输出定量质量报告
- 第五步:对照一致性质量层次,判定是否通过,输出验收报告
- 数据质量评价方法:分为
直接评价法和间接评价法。- 直接评价法:通过将数据与内部或外部的参照信息 (如理论值等) 进行对比来确定数据质量。
- 间接评价法:利用数据相关信息 (如对数据源、采集方法等的描述) 推断或评估数据质量。
- 数据质量控制:分成
前期控制和后期控制两大部分。- 前期控制:数据录入前的质量控制、数据录入过程中的实时质量控制;
- 后期控制:数据录入完成后的后处理质量控制与评价。
6.3.4 数据模型
根据模型应用的目的不同,可以将数据模型划分为 3 类:概念模型、逻辑模型和物理模型。
概念模型:概念模型也称信息模型,它是按用户的观点来对数据和信息建模,也就是说,把现实世界中的客观对象抽象为某一种信息结构,这种信息结构不依赖于具体的计算机系统也不对应某个具体的 DBMS,它是概念级别的模型。基本元素:实体、属性、域、键、关联面向业务 不考虑数据库、软件技术 E-R图逻辑模型:逻辑模型是在概念模型的基础上确定模型的数据结构,目前主要的数据结构有层次模型、网状模型、关系模型、面向对象模型和对象关系模型。其中,关系模型成为目前最重要的一种逻辑数据模型。如:概念转成关系模型结构中关系模式 (数据表)。把概念模型转为关系模型,不考虑数据库产品 二维表物理模型:物理数据模型是在逻辑数据模型的基础上,考虑各种具体的技术实现因素,进行数据库体系结构设计,真正实现数据在数据库中的存放。面向数据库产品,落地逻辑模型 在MySQL中实现
6.3.5 数据建模
数据建模过程包括数据需求分析、概念模型设计、逻辑模型设计和物理模型设计等过程。
数据需求分析:数据需求分析就是分析用户对数据的需要和要求。数据需求分析是数据建模的起点,数据需求掌握的准确程度将直接影响后续阶段数据模型的质量概念模型设计:将需求分析得到的结果抽象为概念模型的过程就是概念模型设计,其任务是确定实体和数据及其关联逻辑模型设计:逻辑模型设计的任务就是将概念模型中的实体、属性和关联转换为关系模型结构中的关系模式物理模型设计:如果要将数据模型转换为真正的数据库结构,还需要针对具体的 DBMS 进行物理模型设计,使数据模型走向数据存储应用环节。物理模型考虑的主要问题包括命名、确定字段类型和编写必要的存储过程与触发器等
6.4 数据仓库和数据资产
6.4.1 数据仓库
为了满足人们对预测、决策分析的需要,在传统数据库的基础上产生了能够满足预测、决策分析需要的数据环境就叫做数据仓库。是面向主题、集成、非易失、随时间变化的数据集合,支撑管理决策
四层架构:

数据源:数据仓库的基础,包括各类数据库存储与管理:数据仓库核心,ETL 抽取清洗加载OLAP 服务器:联机分析处理服务器,多维数据分析- ROLAP:基于关系数据库
- MOLAP:多维数据立方体
- HOLAP:混合架构
前端工具:查询工具、报表工具、数据挖掘工具、分析工具
6.4.2 主题库
主题库建设是数据仓库建设的一部分。主题库是为了便利工作、精准快速地反映工作对象全貌而建立的融合各类原始数据、资源数据等,围绕能标识组织、人员、产权、财务等的主题对象,长期积累形成的多种维度的数据集合。例如,人口主题库、土地主题库、企业主题库、产权主题库、财务主题库、组织主题库等。
主题库建设可采用多层级体系结构,即数据源层、构件层、主题库层。
数据源层:数据源层存放数据管理信息的各种管理表和数据的各类数据表构件层:构件层包括基础构件和组合构件。基础构件包括用户交互相关的查询数据、展现数据和存储数据构件,以及数据维护相关的采集数据、载入数据和更新数据构件。组合构件由基础构件组装而成,能够完成相对独立的复杂功能主题库层:按业务需求通过构建组合,形成具有统一访问接口的主题库
6.4.3 数据资产管理
在数字时代,数据是一种重要的生产要素,把数据转化成可流通的数据要素,重点包含数据资源化、数据资产化两个环节。
数据资源化:通过将原始数据转变为数据资源,使数据具备一定的潜在价值,是数据资产化的必要前提。数据资源化以数据治理为工作重点,以提升数据质量、保障数据安全为目标,确保数据的准确性、一致性、时效性和完整性,推动数据内外部流通。数据资产化:通过将数据资源转变为数据资产,使数据资源的潜在价值得以充分释放。数据资产化以扩大数据资产的应用范围、显性化数据资产的成本与效益为工作重点,并使数据供给端与数据消费端之间形成良性反馈闭环。
数据资产化之后,核心工作:
数据资产流通:通过数据共享、数据开放或数据交易等流通模式,推动数据资产在组织内外部的价值实现。数据共享:打通组织各部门间的数据壁垒,建立统一的数据共享机制,加速数据资源在组织内部流动。数据开放:向社会公众提供易于获取和理解的数据。数据交易:交易双方通过合同约定,在安全合规的前提下,开展以数据或其衍生形态为核心的交易行为。
数据资产运营:对数据服务、数据流通情况进行持续跟踪和分析,以数据价值管理为参考,从数据使用者的视角出发,全面评价数据应用效果,建立科学的正向反馈和闭环管理机制,促进数据资产的迭代和完善,不断适应和满足数据资产的应用和创新。数据价值评估:数据资产管理的关键环节,是数据资产化的价值基线。
6.4.4 数据资源编目
数据资源编目是实现数据资产管理的重要手段。数据资源目录体系设计包括概念模型设计和业务模型设计等,概念模型设计明确数据资源目录的构成要素,通过业务模型设计规范数据资源目录的业务框架。
- 数据资源目录分类
- 资源目录:能够准确浏览组织所记录或拥有的线上、线下原始数据资源的目录,如电子文档索引、数据库表、电子文件、电子表格、纸质文档等
- 资产目录:对原始数据资源进行标准化处理,识别数据资产及其信息要素,包括基本信息、业务信息、管理信息和价值信息等,按照分类、分级,登记到数据资产目录中
- 服务目录:对外提供的可视化共享数据目录。服务目录主要分为两类:一类是指标报表、分析报告等数据应用,可以直接使用;另一类是共享接口,提供鉴权、加密、计量、标签化等功能,并对接外部系统
- 信息项分类
- 数据资源信息项:是记录原始数据资源的元数据流水账,是对原始数据资源的定义描述
- 数据资产信息项:是记录经过一系列处理后所形成的主题数据资源、基础数据资源的元数据流水账,是对数据资产的定义描述
- 数据服务信息项:是记录需要对外提供数据应用、数据接口两类数据服务的元数据流水账,是对数据服务的定义描述
- 数据资源库
- 数据资源库是存储各类数据资源的物理数据库,常分为专题数据资源库、主题数据资源库和基础数据资源库。
- 标准规范
- 元数据规范:描述数据资源所必须具备的特征要素
- 编码规范:规定了数据资源目录相关编码的表示形式、结构和维护规则
- 分类标准:规范了数据资源分类的原则和方法
6.5 数据分析及应用
6.5.1 数据集成
数据集成就是将驻留在不同数据源中的数据进行整合,向用户提供统一的数据视图,使得用户能以透明的方式访问数据。
1、数据集成方法
模式集成:也叫虚拟视图方法,是人们最早采用的数据集成方法,也是其他数据集成方法的基础。其基本思想是:在构建集成系统时,将各数据源共享的视图集成为全局模式,供用户透明地访问各数据源的数据复制集成:将数据源中的数据复制到相关的其他数据源上,并对数据源的整体一致性进行维护,从而提高数据的共享和利用效率。数据复制可以是整个数据源的复制,也可以是仅对变化数据的传播与复制混合集成:该方法为了提高中间件系统的性能,保留虚拟数据模式视图为用户所用,同时提供数据复制的方法
2、数据访问接口标准
数据库访问接口标准,作用:程序不关心底层是什么数据库(MySQL、Oracle),通过统一规范链接数据库
ODBC:ODBC(Open Database Connectivity开放数据库互连) 是用于数据库访问的应用程序编程接口 (API)。ODBC 由应用程序接口、驱动程序管理器、驱动程序和数据源 4 个组件组成JDBC:(Java Database ConnectivityJava 数据库连接)是用于执行 SQL 语句的 Java 应用程序接口,它由 Java 语言编写的类和接口组成。JDBC 是一种规范,其宗旨是各数据库开发商为 Java 程序提供标准的数据库访问类和接口OLE DB:OLE DB(Object Linking and Embedding Database对象链接与嵌入数据库) 是一个基于组件对象模型的数据存储对象,能提供对所有类型数据的操作,甚至能在离线的情况下存取数据ADO:ADO(ActiveX Data ObjectsActiveX 数据对象) 是应用层的接口,它的应用场合非常广泛,不仅可用在 VC、VB、Delphi 等高级编程语言环境,还可用在 Web 开发等领域。ADO 使用简单,易于学习,已成为常用的实现数据访问的主要手段之一。ADO 是 COM 自动接口,几乎所有数据库工具、应用程序开发环境和脚本语言都可以访问这种接口
3、Web Services 技术
Web Services 技术是一个面向访问的分布式计算模型,是实现 Web 数据和信息集成的有效机制。它的本质是用一种标准化方式实现不同服务系统之间的互调或集成。它基于 XML、SOAP (简单对象访问协议)、WSDL (Web 服务描述语言) 和 UDDI (统一描述、发现和集成协议规范) 等协议。
WSDL:(Web Services Description LanguageWeb 服务描述语言)基于 XML 格式的 Web 服务描述语言,通俗解释:接口的详细说明书。SOAP:(Simple Object Access Protocol 简单对象访问协议)消息传递协议,规定 Web Services 之间信息传递规则,通俗解释:网络传输的标准信封。UDDI:(Universal Description Discovery and Integration统一描述、发现和集成协议)注册服务规范,存放、检索 WSDL 文件,类似目录服务器,通俗解释:互联网上的政务服务企业黄页。
4、数据网格技术
数据网格是一种用于大型数据集的分布式管理与分析的体系结构,目标是实现对分布、异构的海量数据进行一体化存储、管理、访问、传输与服务,为用户提供数据访问接口和共享机制,统一、透明地访问和操作各个分布、异构的数据资源。
分布透明性:用户感觉不到数据是分布在不同的地方的异构透明性:用户感觉不到数据的异构性,感觉不到数据存储方式、格式、数据库系统差异数据位置透明性:用户不用知道数据源的具体位置数据访问方式透明性:不同系统访问方式不同,但返回结果统一
6.5.2 数据挖掘
数据挖掘是指从大量数据中提取或 “挖掘” 知识。
1、数据挖掘与传统数据分析区别
数据量:数据挖掘需要更大规模数据,数据量越大效果越好;传统分析数据量较小。分析方法:传统分析仅使用统计学;数据挖掘融合统计、人工智能、可视化等多技术。分析侧重:传统是回顾、验证型,分析已发生事实;数据挖掘是预测、发现型,预判未来、挖掘原因。成熟度:传统统计方法成熟;数据挖掘部分算法仍在迭代发展。
2、数据挖掘核心任务
数据挖掘目标是挖掘数据隐藏规律与关联,支撑决策。核心任务:数据总结、关联分析、分类和预测、聚类分析、孤立点分析。
3、数据挖掘完整流程
确定分析对象:定义清晰挖掘目标,明确业务需求数据准备:挖掘成功的核心前提,分为数据选择、数据预处理(清洗、集成、变换、归约)数据挖掘:分为模型构建、挖掘处理两步,搭建适配算法模型并执行挖掘计算结果评估:对挖掘输出结果做解读、校验、评估结果应用:经业务决策人员确认后落地,指导业务实践,流程可循环迭代
6.5.3 数据服务
数据目录服务:检索服务,快速定位、检索所需数据资源,是数据共享基础功能数据查询与浏览及下载服务:用户获取数据的基础方式,支持在线浏览、条件查询、批量下载数据分发服务:数据生产者向使用者传递数据,核心包含数据发布、数据检索、数据质量评价
6.5.4 数据可视化
一维数据可视化:纯线性数据,如文本、数字表格、代码二维数据可视化:两个核心属性,地图、平面图、GIS 系统为典型三维数据可视化:立体空间信息,3D 建模、仿真模拟多维数据可视化:属性超过三维,一般需要降维展示时态数据可视化:二维特例,一轴为时间,展示数据随时间变化趋势(折线、时序图)层次数据可视化:树形层级结构,组织架构、文件目录、家谱网络数据可视化:无固定层级,节点可关联任意多个其他节点,社交网络、链路拓扑
6.6 数据脱敏和分类分级
6.6.1 数据脱敏
数据使用常常需要经过脱敏化处理,即对数据进行去隐私化处理,实现对敏感信息的保护,这样既能够有效利用数据,又能保证数据使用的安全性。
- 敏感数据分类:
个人敏感数据、商业敏感数据、国家秘密数据;密级划分L1 (公开)、L2 (保密)、L3 (机密)、L4 (绝密)、L5 (私密)。 - 数据脱敏定义:对自然人标识、用户资料等敏感信息模糊、加扰、加密、转换,使原始身份无法识别、推算、关联。
- 脱敏两类方式
- 可恢复:加解密算法,脱敏后可还原原始数据;
- 不可恢复:替换、生成算法,脱敏后无法复原原始数据。
- 数据脱敏六大原则
算法不可逆原则:常规脱敏算法不可逆,防止通过脱敏数据反推原始敏感信息,仅特殊场景允许复敏保持数据特征原则:脱敏后保留原始数据分布特征,满足测试、建模使用需求保留引用完整性原则:主键脱敏时,关联外键同步修改,维持数据表关联关系规避融合风险原则:多源非敏感数据合并后可能产生敏感信息,提前预判并脱敏相关字段脱敏过程自动化原则:依托规则自动执行脱敏,区分生产、测试等环境管控脱敏结果可重复原则:同一字段多次脱敏结果保持稳定(或可控差异化),保障模型、测试可复现
6.6.2 数据分类
数据分类两大要素:分类对象、分类依据。
- 分类对象:待划分的各类数据实体;
- 分类依据:数据自身属性、业务特征;
处理规则:优先遵循国家、行业标准;无行业标准则按企业经营维度分类。
6.6.3 数据分级
数据分级:依据数据泄露后对国家安全、公共利益、个人/企业合法权益的危害程度划分,支撑数据全生命周期安全管控。
分级常用维度:数据特性、价值高低、敏感程度(公开、秘密、机密、绝密)、司法影响范围。
国家三层基础分级框架:核心数据、重要数据、一般数据