一、项目概述
根据公安部2019年4月发布的《公安大数据处理通用技术规范》技术规范要求,各省市需要构建完整规范的数据治理和服务体系,有效支撑大数据智能化应用建设。

根据2019年2月21日全省公安机关“数据赋能”会议决定,要求全省公安机关开展为期两年的“数据赋能”攻坚行动,全面推进智慧警务建设要求。
我市敏锐地觉察到新形势新变化,基于公安智慧警务的现实诉求,日益迫切需要一个基于云计算和大数据架构的大数据综合服务平台,以实现整体it资源的大整合和各类数据的大集中,充分利用高性能的优势, 云计算和大数据技术的高可用性和高扩展性,帮助公安构建智能高效的情报指挥、治安防控、社会管理、执法监管等大数据建设和服务。
二。平台的总体设计要求
本项目建设必须严格遵循公安大数据处理技术的相关标准和规范。要求提供项目建设依据、技术路线和总体架构设计,其中总体架构要求按照警务云四层架构设计。
该平台必须与省厅大数据平台级联,并能根据省厅要求与数据资源目录、服务目录等相关功能对接,以满足省厅日常工作需求和考核需求。
平台建成后,需要通过网络安全等级三级评估。
三。数据服务层的采购需求
数据层是大数据综合服务平台建设的核心,承担着高效利用底层平台能力进行海量数据采集接入、标准化智能处理、精细化组织、精准可控共享服务的关键责任。
平台的数据管理流程和结果必须完全符合部标准,并通过公安部的相关测试。如果维护期间项目的部门标准发生变化,则需要按照新标准免费升级管理。
本次采购所需的治理数据以市公安局提供的数据为准,其中数据治理的类别不少于600类公安数据和200类社会数据,以及所有结构化的感知数据。
数据服务层建设主要利用基础设施服务层的计算、存储和底层服务资源,适应大数据平台,充分发挥大数据组件特性,有效开展数据治理和服务建设。数据服务层主要包括数据访问、数据处理、数据治理、数据组织和数据服务构建。
数据存取
数据接入是指全方位获取和接入各类公安数据,打破部门警务壁垒,拓宽数据接入渠道,接入和聚合公安内部数据、政府其他部门数据、社会行业数据、互联网数据和数据。同时可以优化和增强数据访问方式,满足各种异构数据的访问汇聚。
根据源数据“多源异构”的特点,数据访问为多源异构数据的提取和聚合提供了接口通道。根据公安部《公安大数据处理通用技术规范》中的数据访问要求,数据访问主要包括数据探索、数据定义、数据读取和数据对账功能。
数据探索
数据挖掘是指对源数据存储位置、提供方式、总量和更新、业务含义、字段格式语义、数据结构、数据质量等进行多维分析,从而达到理解数据的目的,为数据定义提供依据。
数据探测需要探测以下维度:
访问方式探讨:探讨源表的存储位置和提供方式;
业务探究:探究源表的业务含义,帮助我们更准确地理解和把握数据;
字段探索:探索源表字段的数据内容,确定其代表意义和统计分布;
探测数据集:根据源表的表名和引用数据元素,探测源表是否为标准数据集。探索数据的总量、增量和更新,为数据的存取、加工和组织提供依据;
数据挖掘:针对源表的数据内容,挖掘字段中不合理的内容。
数据定义
数据定义是根据数据探索结果和业务需求,在初始阶段定义数据访问、处理和治理的内容和方法。
数据定义涉及数据访问、数据处理和数据治理的多个方面,包括数据格式定义、资源目录注册、数据分类定义、数据读取策略定义、数据抽取策略定义、数据清洗策略定义、数据关联策略定义、数据比较策略定义、数据识别策略定义、数据分发策略定义、数据质量检查规则定义。
读出数据
读取数据主要是指在完成数据探索和数据定义后,从源系统提取数据或接收读取源系统推送的数据,并检查数据是否与数据定义一致;不一致的停止访问,并重新探索和定义数据;进一步访问和处理的一致执行。对各种异构数据进行必要的解密和解压缩操作;生成作用于数据整个生命周期的记录id;并将数据转换成字符集,以满足下一步数据处理所需的格式。
数据读取适配要求:支持多样异构的数据源和目标数据库,适配主流数据库和主流云数据库,包括Oracle、Mysql、Sqlserver、Mpp、Greenplum、Postgresql、Gbase、Hive、Hbase、Solr、es、Mongodb、Redis、华为云高斯db。
需要自定义读取规则,包括代码映射、空值替换、字符串操作、字符串替换、字符串截取、添加字段、数据类型转换、公式计算、常规处理、组合字段、身份证操作、关键字段空值、重复、异常问题的数据清理规则。
要求阅图工具具有高效实用的绘图功能,实现操作过程的可视化设计。每个组件和连接线都以图形控制的形式提供,并根据不同的功能进行分组。数据集成任务可以直观地显示在流程设计器中。
要求阅读工具实现WEB模式下的任务开发配置,使任务开发更加灵活、方便、快捷,有效提高开发效率。
数据协调
数据对账是指数据提供方和数据访问方在数据交换过程中,对数据的数量、大小和指纹进行核对和检查的过程。对账后需要进行核销,对账异常需要进行记录。根据数据协调的场景,数据协调分为数据访问协调和数据分发协调。
要求具备即时对账、定时对账、库存对账功能。
数据处理
数据处理是基于数据访问环节的数据定义,针对大数据规模庞大、类型多样、高速流转、复杂多变、质量参差不齐、价值密度不一的特点。它以数据应用为导向,通过标准化处理,提高数据值密度,为数据智能应用实现数据增量、数据准备、数据抽象。
数据处理主要包括数据提取、数据清洗、数据关联、数据比较、数据识别和数据分发。
取数据
数据抽取主要是对原始数据进行标准化处理。数据提取是根据人、地、物、关系等关键要素,从接入的公安、政府、社会资源中提取相关属性信息。数据抽取模块用于将数据作为一种数据资源访问到原始数据库采集层。
数据抽取的来源和目的主要是按照数据组织或业务需求对数据进行转换和整合,获得按照目标数据形式组织的数据。首先获取并分析数据抽取策略或规则,得到源数据集/字段到目的数据集/字段的映射关系和操作规则,然后根据规则进行抽取。
数据清理
数据清洗是规范访问数据和提高数据值密度的过程。通过对原始数据库中不同来源采集的业务数据进行审核、验证,过滤不合规数据,删除重复数据,纠正错误数据,完成格式转换,检查清洗前后的数据一致性,保证清洗结果集的数据质量。
数据清理需要包括数据过滤、重复数据删除、网格转换和验证等功能。
数据关联
数据关联是指根据数据定义中的关联规则或算法,将数据与其他知识数据和业务数据关联起来,输出关联信息,支持关联回填和关联提取。在有效访问数据的情况下,可以实现线上线下的数据关联。
数据比较
数据比较是指在数据处理过程中,根据规则对数据进行相同的比较或相似度计算。对于符合规则的数据,支持根据输出描述输出,常用于信息分发控制和信息订阅。通过将比较目标与比较源的指定字段的值进行比较,可以实时找到比较信息。
需要完全匹配、模糊匹配、范围匹配和规则匹配。
数据识别
基于标签知识,标签引擎用于离线或实时识别数据,为上层应用提供支持。
数据分布
数据提取、清洗、关联、比较、识别完成后,根据不同的数据使用场景和分发策略,将处理过程中产生的关联、关系、标签以及原始数据本身的信息,按照数据定义的要求进行同步或异步处理,得到的数据相应地分发到原始数据库、资源数据库、主题数据库、业务数据库和知识数据库。

数据治理
数据治理是对数据资源全生命周期的规划设计、过程控制和质量监管。通过标准化的数据治理,可以使数据资源透明化、可管可控,可以明晰数据资产,完善数据标准,规范数据处理流程,提高数据质量,保障数据安全使用,促进数据流通和价值提炼。
数据治理包括数据资源目录、数据分类、数据血缘、标签管理、模型管理、数据质量管理和数据运维。
数据资源目录
公安数据资源目录是指按照公安数据资源目录的统一标准,对公安数据资源进行统一管理,实现数据资源的科学、有序、安全使用。数据资源目录主要是对数据资源进行组织、管理和提供服务的过程。其主要目的是明确数据资产,解决数据资源“是什么”、“在哪里”和“如何使用”的问题。通过对数据资源的梳理,根据标准化的元数据,描述数据资源的各种特征,按照一定的编码方式进行编目分类,形成标准、规范、统一的数据资源目录,摸清数据家族背景。搞清楚全警有哪些数据,用数据资源目录和服务,用数据运营的理念指导所有警种。用好数据资源目录,组织管理数据资源目录,推进全警数据资源目录的联动和共享。
数据分类
数据分类是为了描述数据的多维特征和内容敏感性,为制定数据资源开放和共享的策略提供支持。
数据血缘管理
数据血缘分析主要是建立数据资源、数据项、数据资源、数据项之间的三级映射关系,建立血缘数据之间的继承、循环、转换、关联、提取、清洗关系。以上两种关系用于完成数据处理的抽取和关联,记录数据处理的整个历史,包括数据来源和处理结果。
包括具体的表级血缘和字段级血缘分析功能。
标签管理
标签是对数据和数据集的某种特征的描述,可以增加数据维度,扩展数据属性,提供基于数据的抽象。以模型和服务的形式向各类警察开放。每种警察都可以根据自己的业务特点建立自己的数据标签。通过标签服务,可以完成标签创建、上线、停用的管理。
包括标签项目管理、标签分类管理、标签生命周期管理、标签模型管理和标签方案管理。
模型管理
模型管理是平台通过模型框架引擎提供的个性化、可配置的计算和分析功能服务。可以根据规范开发的模型算法可以在多个平台上管理、调度和执行。
数据质量管理
数据质量管理是指通过建立数据质量评价标准,在数据定义阶段建立质量检查规则和管理规范,形成问题数据库和数据质量分析报告,并对修复后的数据进行循环检查,协助建立数据质量改进机制,及时发现问题数据,尽快修复,对在线实时数据和存储数据进行数据质量检查。
具体要求包括监测数据采集、数据质量评价标准、验证规则管理、监测方案配置管理、问题数据发现与跟踪、质量报告内容等。
数据运维管理
数据运维管理是指通过采集源数据、数据访问、数据处理、数据组织和数据服务任务的状态信息,对异常状态进行预警,从而监控各个治理环节的运行状态。为全面掌握公安大数据平台数据治理提供有力保障。
所需的主要功能包括实时状态采集、运行状态监控、数据运维报表、运维日志审计、监控指标设计和监控预警管理。
数据资源可视化
从大数据治理各子功能后台自动读取本地数据中心对应的统计信息,采集后台元数据信息和监控信息,利用可视化展示技术展示大数据管理治理数据成果,查看各种监控信息。
数据结构
根据公安大数据处理数据组织相关技术要求,数据资源数据库将按照统一标准进行分类。数据组织主要包括原始数据库、资源库、主题数据库、知识库、业务数据库和业务要素索引数据库的建设。
原始库
通过接入和汇聚警务资源、社会资源、政府资源,形成平台整体数据资源。不同渠道访问的数据格式不同,所以按照数据的原始格式存储,形成原始数据库,支持所有数据类型。原始数据库是公共数据的集合,整合了各警种、各部门的各种数据资源,支持各种业务。它可以独立于任何业务而存在,并且与每个业务相关。
要求原库具有集合库、标准库和题库的内容。
资源库
资源数据库是一个公共数据集合,它集成了建立各种数据资源的关键要素,以及这些要素之间的关联和关系。主要包括:元素及其行为的时间空分布,其内容,与主要元素相关的时间空分布,不同主体之间关系的时间空分布。
要求资源数据库包括元素关联数据库、元素关系数据库、元素行为数据库、元素内容数据库和元素分布数据库。
主题库
主题数据库是一个多维度的公共数据集合,是为了方便工作和准确快速地反映工作对象的全貌而建立的,整合了各种原始数据和资源数据,围绕能够长期识别人、地、案、事、组织的主题对象进行积累,包括人员主题数据库、场所主题数据库、对象主题数据库、案件主题数据库、事件主题数据库、信息主题数据库和组织主题数据库。
商业图书馆
业务库是根据特定的应用业务模型,通过二次提取和整合的方法,面向特定的业务应用需求,以满足各种业务发展需求的专用应用资源库。通过对业务库数据的数据采样、数据重构和业务提取,构建面向基础应用的基础业务库。其中,业务数据库主要由各业务警务部门建立。
知识库
知识库是指公共安全领域共享的知识数据和规则、方法的集合,包括数据访问、处理、治理、组织和服务所需的知识数据,各种规则、方法和流程的集合,以及公共安全领域各种通用模型所需的知识数据和通用算法。包括基本知识库、基本算法库和规则库。
商业元素索引库
业务元素索引数据库是业务数据库关键元素的全局索引,用于解决业务关联和业务冲突问题。
数据服务
根据公安大数据处理数据服务的技术要求,数据服务提供数据访问和管理能力。数据服务分为七大类,分别是:查询和检索服务、比较和订阅服务、数据推送服务、数据操纵服务、模型分析服务、数据认证服务和数据管理服务。
搜索服务
查询服务包括数据资源的查询接口,以及各种数据的查询接口。支持精确和模糊查询方式,支持分类、组合和批量查询方式,支持返回数据的统计汇总信息、判断查询关键字是否命中的信息、数据汇总或明细信息。
匹配订阅服务
比较订阅服务是针对一个或多个动态活动的信息订阅服务。
要求按照输入的比对条件或预设规则与数据进行比对,比对时会实时返回比对结果信息。支持完全匹配、模糊匹配、关键字匹配、规则匹配和多条件逻辑组合匹配。
比较订阅服务需要订阅单个条件或批量条件数据的比较结果,即根据输入的单个或多个比较条件,将数据与完全匹配规则进行比较,比较结果返回比较信息。
数据推送服务
数据推送服务是公安大数据综合服务平台各级节点之间、公安网内外其他部门之间进行数据交换和信息推送的基础核心能力,主要包括数据汇聚和数据分发。
数据操作服务
数据运营服务涉及大数据综合服务平台中相关数据资源的“数据写入”操作。操作范围内的对象包括“原始数据库、资源数据库、主题数据库、业务数据库、索引数据库、知识数据库”,还涉及到云平台中各种异构数据库组件的适配。为了保证大数据处理流程的严谨性和可靠性,以及唯一的数据运营入口,数据运营服务由大数据处理和治理工具提供服务接口。
模型分析服务

模型分析服务是指根据业务需求,对数据进行统计、分析、定期探索和预测,并返回结果,以支持应用级业务场景复杂多变的需求。
数据认证服务
认证服务要求所有的数据服务请求都必须验证请求者的权限,以保证请求者访问的数据在权限范围内,这是大数据平台保证数据安全的核心。
数据管理服务
数据服务管理是指按需提供数据治理和数据服务能力的接口封装,为平台中的其他应用系统和其他子系统提供服务。
免责声明:本平台仅供信息发布交流之途,请谨慎判断信息真伪。如遇虚假诈骗信息,请立即举报
举报













