随笔分类 -  hive

摘要:#!/bin/bash id=`hive -e "set hive.cli.print.header=false;select id,name from test.test where name = 'wangwu' group by id,name;"` echo echo $id echo 阅读全文
posted @ 2021-07-20 17:38 快乐的张小凡 阅读(105) 评论(0) 推荐(0)
摘要:select size(m), --求map的长度 map_keys(m), --将map中对应的所有keys.存储格式为array map_values(m), --将map中对应的所有values sort_array(map_keys(m)), --对map的keys进行排序 array_co 阅读全文
posted @ 2021-06-07 09:29 快乐的张小凡 阅读(1122) 评论(0) 推荐(0)
摘要:语法: split(string str, string pat)返回值: array说明: 按照pat字符串分割str,会返回分割后的字符串数组举例:1.基本用法 hive> select split('abcdef', 'c') from test;["ab", "def"]2.截取字符串中的某 阅读全文
posted @ 2021-06-07 09:25 快乐的张小凡 阅读(8719) 评论(0) 推荐(0)
摘要:文件数目过多,会给HDFS带来压力,并且会影响处理效率,可以通过合并Map和Reduce的结果文件来消除这样的影响: set hive.merge.mapfiles = true ##在 map only 的任务结束时合并小文件 set hive.merge.mapredfiles = false 阅读全文
posted @ 2021-05-22 14:13 快乐的张小凡 阅读(578) 评论(0) 推荐(0)
摘要:yyyy-MM-dd与yyyyMMdd000000转换的三种方法 方法一:date_format(只支持yyyy-MM-dd -> yyyyMMdd000000) select date_format('2019-10-07', 'yyyyMMdd000000') -- 20191007000000 阅读全文
posted @ 2021-04-21 10:56 快乐的张小凡 阅读(1926) 评论(0) 推荐(0)
摘要:refresh table tablename ;MSCK REPAIR TABLE table_name;在更改分区内的文件后刷新表 refresh table tablename ; 我们平时通常是通过alter table add partition方式增加Hive的分区的,但有时候会通过HD 阅读全文
posted @ 2020-11-22 22:25 快乐的张小凡 阅读(408) 评论(0) 推荐(0)
摘要:第一节:简介 hive的优化 mapreduce的优化 1个reducetask对应的数据量最好不超过2G reducetask的个数最好不超过0.95*datanode的个数 第二节:优化手段 一、合理选择排序 二、合理做笛卡尔积 三、in/exists效率低 hive 高效实现手段 inner 阅读全文
posted @ 2019-06-30 17:19 快乐的张小凡 阅读(144) 评论(0) 推荐(0)
摘要:第一节:简介 一、数据倾斜 数据倾斜:由于数据分布不均匀,造成数据大量的集中到一点,造成数据热点。 大数据中不怕数据量大,怕数据倾斜。 hive的数据倾斜 mapreduce的数据倾斜。 二、主要表现形式 hive运行日志中 map 100% reduce 97% map 100% reduce 9 阅读全文
posted @ 2019-06-30 17:17 快乐的张小凡 阅读(900) 评论(0) 推荐(0)
摘要:一、简介 hive运行的本质就是将hql语句,转换为一组操作符 operator。这里的 operator 代表 mapreduce操作和hdfs的操作,是hive执行hql语句的最小单位。 二、几个典型语句的分析 1、join 2、group by 3、order by shuffle 的排序,二 阅读全文
posted @ 2019-06-30 17:13 快乐的张小凡 阅读(210) 评论(0) 推荐(0)
摘要:一、进入hive之前的操作 1、简介 进入hive客户端之前的操作 hive [-hiveconf x=y]* [<-i filename>]* [<-f filename>|<-e query-string>] 2、设置参数相关的 -hiveconf set key=value hive -hiv 阅读全文
posted @ 2019-06-16 23:27 快乐的张小凡 阅读(223) 评论(0) 推荐(0)
摘要:一、简介 在hive中默认只支持单字节分隔符,不支持多字节(超过一个字节)分割符的。 单字节:| . : \t 多字节:|| :: .. create table test01(id int,name string) row format delimited fields terminated by 阅读全文
posted @ 2019-06-16 23:26 快乐的张小凡 阅读(628) 评论(0) 推荐(0)
摘要:一、简介 有一定的格式的字符串 map{}+array[]...... 二、解析方式 1、自己定义udf 2、使用内置的函数 get_json_object(json_txt, path) 参数1:需要解析的json字符串 参数2:路径,需要解析出来的当前json串中的路径 根目录:最外层的目录 $ 阅读全文
posted @ 2019-06-16 23:25 快乐的张小凡 阅读(706) 评论(0) 推荐(0)
摘要:第一节:内置函数 一、显示内置函数列表 show functions; 默认271个 二、查看函数的基本使用 desc function funname; desc function max; 三、查看函数的详细使用教程 desc function extended funname; desc fu 阅读全文
posted @ 2019-06-16 23:23 快乐的张小凡 阅读(553) 评论(0) 推荐(0)
摘要:第一节:原子数据类型 9种 整型4种 :tinyint、smallint、int、bigint 浮点型:float 、double 布尔:boolean 字符串:string 时间戳:timestamp 第二节:复杂数据类型 一、简介 所有的复杂数据类型都是由原子数据类型构成 二、array 1、概 阅读全文
posted @ 2019-06-16 23:21 快乐的张小凡 阅读(682) 评论(0) 推荐(0)
摘要:第一节:数据库 Hive的数据库同mysql中的数据库,将数据进行细化管理,不同业务模块的数据放在一个数据库中。 第二节:数据表 一、按管理权限分 1、内部表 管理权限是hive自己,hive对表中的数据(原始数据)有绝对的增删权限的。内部表在进行删除表的时候,表中的数据(hdfs对应的目录)会被删 阅读全文
posted @ 2019-06-16 23:17 快乐的张小凡 阅读(367) 评论(0) 推荐(0)
摘要:第一节:hive的产生背景 mapreduce处理的绝大多数的数据,都是格式化的数据。格式化的数据的处理sql最擅长。mapjoin reducejoin的开发代码要写40行,而sql就一个sql语句就可以了,例如:select * from a join b on a.id=b.id;。 mapr 阅读全文
posted @ 2019-06-16 23:14 快乐的张小凡 阅读(243) 评论(0) 推荐(0)
摘要:1、建库 create database mydb; create database if no exists mydb; create database if no exists mydb location "/aa/bb"; 2、查询数据库 查询库列表:show databases; 查询库详细 阅读全文
posted @ 2019-06-09 21:50 快乐的张小凡 阅读(156) 评论(0) 推荐(0)