文章分类 - Hive
摘要:http://www.open-open.com/lib/view/open1400644430159.html
阅读全文
摘要:http://yugouai.iteye.com/blog/1908121窗口函数应用场景:(1)用于分区排序(2)动态Group By(3)Top N(4)累计计算(5)层次查询一、分析函数用于等级、百分点、n分片等。函数说明RANK()返回数据项在分组中的排名,排名相等会在名次中留下空位DENS...
阅读全文
摘要:http://sis(URL被和谐)huok.com/forum/blogPost/list/6229.html;jsessionid=89F671F8FBD23C1162CF1908C56251C6第一部分:Hadoop 计算框架的特性 什么是数据倾斜 •由于数据的不均衡原因,导致数据分布不均匀,...
阅读全文
摘要:http://blog.csdn.net/longzilong216/article/details/21244985接触越多,越需要了解hive背后的理论知识以及底层的一些实现细节,会让用户更加高效地使用Hive --摘于HIVE 编程指南.----1 使用EXPLAIN 了解Hive是如何工...
阅读全文
摘要:http://www.tbdata.org/archives/2109在做Shuffle阶段的优化过程中,遇到了数据倾斜的问题,造成了对一些情况下优化效果不明显。主要是因为在Job完成后的所得到的Counters是整个Job的总和,优化是基于这些Counters得出的平均值,而由于数据倾斜的原因造成...
阅读全文
摘要:http://blog.csdn.net/preterhuman_peak/article/details/40649213优化时,把hive sql当做map reduce程序来读,会有意想不到的惊喜。理解hadoop的核心能力,是hive优化的根本。这是这一年来,项目组所有成员宝贵的经验总结。长...
阅读全文
摘要:http://www.tuicool.com/articles/rMvQvmlimit限制调整--因为使用limit语句时候,是先执行整个查询语句,然后再返回部分结果的set hive.limit.optimize.enable=true;set hive.limit.row.max.size=10...
阅读全文
摘要:http://www.cnblogs.com/ggjucheng/archive/2013/01/30/2868993.html背景假设有一个学生各门课的成绩的表单,应用hive取出每科成绩前100名的学生成绩。这个就是典型在分组取Top N的需求。解决思路对于取出每科成绩前100名的学生成绩,针对...
阅读全文
摘要:http://www.open-open.com/lib/view/open1328413245124.html用hbase做数据库,但由于hbase没有类sql查询方式,所以操作和计算数据非常不方便,于是整合hive,让hive支撑在hbase数据库层面 的 hql查询.hive也即 做数据仓库 ...
阅读全文
摘要:http://blog.csdn.net/hguisu/article/details/189867591. Hive是什么1) Hive是什么?这里引用 Hive wiki 上的介绍:Hive is a data warehouse infrastructure built on top of H...
阅读全文
摘要:http://luoshi0801.iteye.com/blog/1818984hive sql对hdfs的操作最终都会转化为mr任务,下面介绍如何将已经存在的hdfs文件“导入”hive表,很简单条件及要求:1)hdfs文件为经过lzo压缩的seqFile2)seqFile数据样例 127.0.0...
阅读全文
摘要:http://www.360doc.com/content/14/0724/09/7839419_396675759.shtml一、使用Sqoop将MySQL中的数据导入到HDFS/Hive/HBase2.3HBase中的数据导出到mysql目前没有直接的命令将HBase中的数据导出到MySQL,但...
阅读全文
摘要:http://my.oschina.net/coolbash/blog/112741Hive和Hbase有各自不同的特征:hive是高延迟、结构化和面向分析的,hbase是低延迟、非结构化和面向编程的。Hive数据仓库在hadoop上是高延迟的。Hive集成Hbase就是为了使用hbase的一些特性...
阅读全文
摘要:http://www.csdn.net/article/2015-01-13/2823530摘要:Hive查询生成多个map reduce job,一个map reduce job又有map,reduce,spill,shuffle,sort等多个阶段,所以针对hive查询的优化可以大致分为针对MR...
阅读全文
摘要:http://conkeyn.iteye.com/blog/2011987HiveQL是一种声明式语言,最终会被编译为MapReduce job提交到Hadoop执行。大多情况下,用户并不需要知道Hive是如何运作——只关注手头的业务处理问题就行了。虽然Hive引擎会在在 HiveQL语句编译过程中...
阅读全文
摘要:http://www.kuqin.com/datawarehouse/20080505/7908.html高效实现数据仓库的七个步骤 数据仓库和我们常见的RDBMS系统有些亲缘关系,但它又有所不同。如果你没有实施过数据仓库,那么从设定目标到给出设计,从创建数据结构到编写数据分析程序,再到面对挑剔的用...
阅读全文
摘要:FROM:http://shiyanjun.cn/archives/588.htmlHive是基于Hadoop平台的,它提供了类似SQL一样的查询语言HQL。有了Hive,如果使用过SQL语言,并且不理解Hadoop MapReduce运行原理,也就无法通过编程来实现MR,但是你仍然可以很容易地编写...
阅读全文

浙公网安备 33010602011771号