随笔分类 -  Hive

摘要:HIVE的UDF 新建java工程,导入hive相关包,导入hive相关的lib。 创建类继承UDF 自己编写一个evaluate方法,返回值和参数任意。 为了能让mapreduce处理,String要用Text处理。 将写好的类打成jar包,上传到linux中 在hive命令行下,向hive注册U 阅读全文
posted @ 2016-08-21 00:03 周蓬勃 阅读(199) 评论(0) 推荐(0)
摘要:HIVE语法 0.数据类型 TINYINT - byte SMALLINT - short INT - int BIGINT - long BOOLEAN - boolean FLOAT - float DOUBLE - double STRING - String TIMESTAMP - Time 阅读全文
posted @ 2016-08-21 00:01 周蓬勃 阅读(353) 评论(0) 推荐(0)
摘要:HIVE外部表 分区表 外部表 创建hive表,经过检查发现TBLS表中,hive表的类型为MANAGED_TABLE. 在真实开发中,很可能在hdfs中已经有了数据,希望通过hive直接使用这些数据作为表内容。 此时可以直接创建出hdfs文件夹,其中放置数据,再在hive中创建表管来管理,这种方式 阅读全文
posted @ 2016-08-21 00:00 周蓬勃 阅读(3058) 评论(1) 推荐(0)
摘要:HIVE配置mysql metastore hive中除了保存真正的数据以外还要额外保存用来描述库、表、数据的数据,称为hive的元数据。这些元数据又存放在何处呢? 如果不修改配置hive默认使用内置的derby数据库存储元数据。 derby是apache开发的基于java的文件型数据库。 可以检查 阅读全文
posted @ 2016-08-20 23:59 周蓬勃 阅读(4206) 评论(0) 推荐(0)
摘要:HIVE入门 $show databases; 执行后发现默认有一个库default $show tables; 发现没有任何表,证明不use其他库时,默认就是default库。 $create database tedu; 发现在hdfs中多出了/user/hive/warehouse/tedu. 阅读全文
posted @ 2016-08-20 23:58 周蓬勃 阅读(384) 评论(0) 推荐(0)
摘要:HIVE的安装配置 首先需要hadoop的支持,启动好hadoop 下载:从apache官网下载新版本hive,要注意和hadoop版本的匹配。 支持: 需要对应版本jdk的支持 需要安装并运行hadoop 安装: 将下载好的hive安装包上传到linux中。 解压:tar -zxvf apache 阅读全文
posted @ 2016-08-20 23:57 周蓬勃 阅读(266) 评论(0) 推荐(0)
摘要:HIVE是什么 开发调试麻烦 只能用java开发 需要对hadoop的底层及api比较了解才能开发复杂代码 HQL Hive是基于Hadoop的一个数据仓库工具。可以将结构化的数据文件映射为一张数据库表,并提供完整的sql查询功能,可以将sql语句转换为MapReduce任务进行运行。其优点是学习成 阅读全文
posted @ 2016-08-20 23:56 周蓬勃 阅读(239) 评论(0) 推荐(0)