随笔分类 -  数据

摘要:方案1: 数据同步过程中加密 通过大数据平台(如数栖平台),在数据同步过程中,利用一些脚本语言(如 数栖平台适配的groovy语言)进行加密,加密规则可自行定义方案2: 在数据仓库侧进行加密 现将数据同步到数据仓库,然后通过一些加密函数或者自定义的加密函数(udf)进行数据加密,然后将未脱敏数据删除 阅读全文
posted @ 2020-05-18 08:42 后山前堂客 阅读(1250) 评论(0) 推荐(0)
摘要:hive表中 desc 及 show create table 查出来字段和表的中文comment全是 ?解决方案: 1、进入CDH的元数据库mysql执行:show create database hive; 发现默认是utf8类型 mysql> show create database hive 阅读全文
posted @ 2020-04-26 19:49 后山前堂客 阅读(315) 评论(0) 推荐(0)
摘要:平台上执行复杂查询,OOM,根据日志提示的结局方法: -- SET spark.driver.memory=6/8G;【还是OOM】set spark.sql.autoBroadcastJoinThreshold=-1;【解决问题】 Exception in thread "broadcast-ex 阅读全文
posted @ 2019-11-21 08:20 后山前堂客 阅读(1850) 评论(0) 推荐(0)
摘要:mysql数据库的Character Set是 utf8mb4, Collation 是 utf8mb4_bin,如下图所示: sql语句: create table test_emoji(id int, emoji varchar(1000)); insert into test_emoji va 阅读全文
posted @ 2019-11-07 23:19 后山前堂客 阅读(486) 评论(0) 推荐(0)
摘要:-- select * from ods_eventID limit 10; select logmessage, -- regexp_extract(logmessage,'\\"Services\sType:ICALL\\"',0) as serviceType regexp_extract(r 阅读全文
posted @ 2019-10-09 12:28 后山前堂客 阅读(182) 评论(0) 推荐(0)
摘要:concat_ws() 在hive中,被连接对象必须为string或者array<string>,否则报错如下: hive> select concat_ws(',',unix_timestamp('2012-12-07 13:01:03'),unix_timestamp('2012-12-07 1 阅读全文
posted @ 2018-06-20 15:07 后山前堂客 阅读(3171) 评论(0) 推荐(0)
摘要:select split("2405F5 (base 16) Integrated Device Technology (Malaysia) Sdn. Bhd.","\\(base 16\\)")[0] 输出结果为: 2405F5 阅读全文
posted @ 2018-06-19 21:13 后山前堂客 阅读(3305) 评论(0) 推荐(0)
摘要:开发平台上的sql不能超过1000行,而为了插入尽可能随机的数据,sql比较长 插入一行数据就需要执行80行sql,因此执行insert into mall_data.dtw_mall2_tmp values(***),(***)...这样格式数据插入,每次最多插入10条数据(800行sql)。如果 阅读全文
posted @ 2018-06-19 15:21 后山前堂客 阅读(838) 评论(0) 推荐(0)
摘要:建表,多设置一个字段id_tmp create table if not exists mall_data.dtw_mall2_adm_customer_d_tmp( id_tmp string comment '临时创建的id', mac_addr string comment 'Mac地址', 阅读全文
posted @ 2018-06-19 13:56 后山前堂客 阅读(668) 评论(0) 推荐(0)
摘要:INSERT OVERWRITE DIRECTORY '/abc/def/gk' ROW FORMAT delimited fields terminatd by '\t' stored as textfile select * from dtw.dtw_dwd_property_work_orde 阅读全文
posted @ 2018-06-19 09:34 后山前堂客 阅读(242) 评论(0) 推荐(0)
摘要:1 数据准备 create table stocks(id int, date string,price string, company string); insert into table stocks values (1,'2010-01-04','214.01','aapl'), (2,'20 阅读全文
posted @ 2018-06-19 00:36 后山前堂客 阅读(6849) 评论(0) 推荐(0)
摘要:需求: 三个不同的dfs中存在不同的多个节点id,现在需要求出不同的dfs之间的节点对应关系,比如,哪些节点在某一个dfs,但是不在另一个dfs中 思路: 一、 如果是单纯计算dfs中节点数量,则可以使用scala,代码如下: 1 准备原始数据 将原始数据存放在文本文件dfs_id中(本文通过sub 阅读全文
posted @ 2018-06-18 13:18 后山前堂客 阅读(413) 评论(0) 推荐(0)
摘要:数据处理过程中,需要excel进行简单的操作,比如vlookup,摸索之后,总结如下: 阅读全文
posted @ 2018-06-18 08:02 后山前堂客 阅读(179) 评论(0) 推荐(0)
摘要:1 为了便于测试,需要mock一些数据,并尽可能随机散列,比如说要为每个客户随机生成一个字段值 到访客户 / 成交客户 / 会员客户实现方式: split('到访客户 成交客户 会员客户',' ')[cast(rand()*3 as int)] 通过rand()生成随机小数0-1之间 cast(do 阅读全文
posted @ 2018-06-17 22:59 后山前堂客 阅读(668) 评论(0) 推荐(0)
摘要:描述: 本地测试环境hive中有数据,存储格式为textfile,现在要上传到公司开发环境,存储格式为parquet, 如何实现??? tb_textfile表 > local file >tb_parquet(❌) tb_textfile表 > local file >tb_textfile_tm 阅读全文
posted @ 2018-06-17 22:47 后山前堂客 阅读(3657) 评论(0) 推荐(0)
摘要:经过反复试验,最终重启hdfs和hive解决问题 1 hive> insert overwrite local directory '/Users/wooluwalker/Desktop/' select * from tb_test; 2 Total jobs = 1 3 Launching Jo 阅读全文
posted @ 2018-06-17 21:18 后山前堂客 阅读(699) 评论(0) 推荐(0)
摘要:1 原材料 1.1 已经安装好的伪分布式hadoop,版本2.8.3(参见链接https://www.cnblogs.com/wooluwalker/p/9128859.html) 1.2 apache-hive-2.3.3-bin.tar.gz 1.3 已经安装好的mysql(mysql-5.7. 阅读全文
posted @ 2018-06-03 16:17 后山前堂客 阅读(313) 评论(0) 推荐(0)
摘要:1 原材料 1.1 mysql-5.7.22-macos10.13-x86_64.dmg 2 msql在macbook下的安装: 双击dmg进行解压, 再双击解压出来的pkg文件进行安装 3. Continue -> Continue, Agree -> Install -> 输入管理员密码 4. 阅读全文
posted @ 2018-06-03 14:38 后山前堂客 阅读(165) 评论(0) 推荐(0)
摘要:1 准备原材料 1.1 jdk 1.8.0_171(事先安装并配置环境变量HAVA_HOME,PATH) 1.2 Hadoop 2.8.3 2 免密登陆配置(否则安装过程需要不断输入密码) 2.1 开启macbook 允许远程登录 系统偏好设置--共享--选中 远程登录(远程登录状态为绿灯时,说明O 阅读全文
posted @ 2018-06-03 12:51 后山前堂客 阅读(678) 评论(0) 推荐(0)