随笔分类 - Hive
摘要:HIVE的UDF 新建java工程,导入hive相关包,导入hive相关的lib。 创建类继承UDF 自己编写一个evaluate方法,返回值和参数任意。 为了能让mapreduce处理,String要用Text处理。 将写好的类打成jar包,上传到linux中 在hive命令行下,向hive注册U
阅读全文
摘要:HIVE语法 0.数据类型 TINYINT - byte SMALLINT - short INT - int BIGINT - long BOOLEAN - boolean FLOAT - float DOUBLE - double STRING - String TIMESTAMP - Time
阅读全文
摘要:HIVE外部表 分区表 外部表 创建hive表,经过检查发现TBLS表中,hive表的类型为MANAGED_TABLE. 在真实开发中,很可能在hdfs中已经有了数据,希望通过hive直接使用这些数据作为表内容。 此时可以直接创建出hdfs文件夹,其中放置数据,再在hive中创建表管来管理,这种方式
阅读全文
摘要:HIVE配置mysql metastore hive中除了保存真正的数据以外还要额外保存用来描述库、表、数据的数据,称为hive的元数据。这些元数据又存放在何处呢? 如果不修改配置hive默认使用内置的derby数据库存储元数据。 derby是apache开发的基于java的文件型数据库。 可以检查
阅读全文
摘要:HIVE入门 $show databases; 执行后发现默认有一个库default $show tables; 发现没有任何表,证明不use其他库时,默认就是default库。 $create database tedu; 发现在hdfs中多出了/user/hive/warehouse/tedu.
阅读全文
摘要:HIVE的安装配置 首先需要hadoop的支持,启动好hadoop 下载:从apache官网下载新版本hive,要注意和hadoop版本的匹配。 支持: 需要对应版本jdk的支持 需要安装并运行hadoop 安装: 将下载好的hive安装包上传到linux中。 解压:tar -zxvf apache
阅读全文
摘要:HIVE是什么 开发调试麻烦 只能用java开发 需要对hadoop的底层及api比较了解才能开发复杂代码 HQL Hive是基于Hadoop的一个数据仓库工具。可以将结构化的数据文件映射为一张数据库表,并提供完整的sql查询功能,可以将sql语句转换为MapReduce任务进行运行。其优点是学习成
阅读全文

浙公网安备 33010602011771号