09 2021 档案
摘要:Master Thread 是核心的后台线程。 InnoDB 1.0.x 版本之前(MySQL 5.1 之前): Master Thread 具有最高的线程优先级别。内部由多个循环(loop)组成:主循环(loop)、后台循环(backgroup loop)、刷新循环(flush loop)、暂停循
阅读全文
摘要:1.定义数据库和实例 数据库(文件的集合):物理操作系统文件或其他形式文件类型的集合。在MySQL数据库中,数据库文件可以是frm、MYD、MYI、ibd结尾的文件;当使用NDB引擎时,数据库文件是存放于内存中的文件。 实例(程序):MySQL数据库由后台线程以及一个共享内存区组成。共享内存区可以被
阅读全文
摘要:状态一致性: at-most-once:数据最多处理一次,可能缺失数据。 at-least-once:数据最少处理一次,可能重复处理。 exactlly-once:数据正确处理,不重复不缺失。 端到端(end-to-end)状态一致性: 内部保证:checkpoint source端:外部源重设数据
阅读全文
摘要:流式计算分为 无状态 和 有状态 两种情况。 无状态流处理:接收数据,根据最新输入数据生成输出数据 有状态流处理:维护状态(根据每条输入记录进行更新),并基于最新输入的记录和当前的状态值生成输出记录 有状态的算子和应用程序:状态始终与特定算子关联,有两种类型状态 算子状态(operator stat
阅读全文
摘要:WaterMark(水位线): 对由于网络、分布式等问题造成的乱序数据,事件不是严格地按照事件的 EventTime 顺序排列。一旦出现乱序,只根据 EventTime 决定 window 运行,不能明确保证数据是否到位。WaterMark 就是保证一个特定的事件后,必须出发 window 进行计算
阅读全文
摘要:Flink 流式处理中,涉及如下时间: Event Time:事件创建时间 Ingestion Time:数据进入 Flink 时间 Processing Time:每一个执行基于时间操作算子的本地系统时间 若要使用 Event Time,需要环境变量引入时间属性:(1.12默认使用事件时间,不需要
阅读全文
摘要:Window 是无限数据流处理的核心,Window 将无限数据流切割成有限块进行处理(将一个无限的 stream 拆分成有限大小的 “bucket”桶,在桶上做计算处理) Window 可以分成两大类: CountWindow(根据 数据量):根据窗口中相同的 key 数触发执行(不是输入元素总个数
阅读全文
摘要:flink 的对外输出操作都要利用 Sink 完成,常用的 Sink 有 kafka、 redis、elasticsearch、jdbc等。 1、首先引入对应的 connector 依赖 2、创建类实现在 sink 中的方法 3、最后 addSink
阅读全文
摘要:Flink 在运行时包含四个组件: JobManager(作业管理器): 控制一个应用程序运行的主进程。负责向 ResourceManager 申请资源,负责所有需要中央协调的操作(比如说 检查点的协调) ResourceManager(资源管理器): 负责管理 TaskManager 的 slot
阅读全文
摘要:flink的部署模式有两种:一种是单独部署,一种是yarn来进行一个资源的调度 Standalone模式: flink自己来做一个资源的调度分配,通常结合Zookeeper来进行一个高可用。 Yarn模式: yarn模式下又分成两种,一种是 Session-Cluster ,另一种是 Per-Job
阅读全文
摘要:ods:数据引入层 (原始数据导入,不做修改) dwd:公共汇总粒度事实层(粒度不变,提供数据质量) dws:明细粒度事实层(最细粒度 宽表层) ads:数据应用层(根据指标构建)
阅读全文
摘要:一、数仓建模目的 访问性能:数据快速查询,减少io 数据成本:减少数据冗余,计算结果服用,降低存储和计算成本 使用效率:改善用户应用体验,提高使用数据效率 数据质量:改善数据统计口径的不一致,减少数据计算错误的可能性,提工高质量、一致的数据访问平台 二、数仓建模方法 1、维度建模:按照事实表、维表来
阅读全文
摘要:source 是flink的数据源,简单介绍四种读取数据的方式: 1.从集合中读取 2.从文件中读取 3.从kafka中读取 4.自定义Source 1 package com.jy.bjz.source; 2 3 import org.apache.flink.api.common.seriali
阅读全文
摘要:查看Ubuntu openssh 版本 ssh -V
阅读全文
摘要:使用流处理实现WordCount,代码如下: 1 package com.jy.bjz.wc; 2 3 import org.apache.flink.api.java.tuple.Tuple2; 4 import org.apache.flink.streaming.api.datastream.
阅读全文
摘要:复习一下,写一个简单的flink批处理小程序: 创建maven项目,引入依赖(注意引入 flink-clients_2.12,flink1.11后 flink-java 移除了这个依赖,需要手动添加,否则会报错 No ExecutorFactory found to execute the appl
阅读全文
摘要:mvn install:install-file -Dfile=(jar包位置) -DgroupId=(group的id) -DartifactId=(artifact的id) -Dversion=(版本号) -Dpackaging=jar
阅读全文
摘要:Netcat 是一款简单的Unix工具,使用UDP和TCP协议。 它是一个可靠的容易被其他程序所启用的后台操作工具,同时它也被用作网络的测试工具或黑客工具。 使用它你可以轻易的建立任何连接。内建有很多实用的工具。 centos安装: yum install -y nc 模拟9999端口发送消息 nc
阅读全文
摘要:1.HiveETL预处理 简述:预先对数据按照key进行聚合,或者是预先和其他表进行join,然后在spark作业中针对的数据源就是预处理后的Hive表,不需要使用原先的shuffle类算子执行。 使用场景:导致数据倾斜的是Hive表。如果Hive表中的数据本身很不均匀(比如某个key对应100w数
阅读全文
摘要:解决问题:要求使用sql查询出连续三天登录的用户 1.建表: CREATE TABLE `tmp` ( `name` varchar(255) NOT NULL, `login_date` datetime DEFAULT NULL ) ENGINE=InnoDB DEFAULT CHARSET=u
阅读全文
摘要:查询语句如下: SELECT VERSION() FROM DUAL; 结果如下
阅读全文

浙公网安备 33010602011771号