摘要:
一、背景1、当进程在进行远程通信时,彼此可以发送各种类型的数据,无论是什么类型的数据都会以二进制序列的形式在网络上传送。发送方需要把对象转化为字节序列才可在网络上传输,称为对象序列化;接收方则需要把字节序列恢复为对象,称为对象的反序列化。2、Hive的反序列化是对key/value反序列化成hive table的每个列的值。3、Hive可以方便的将数据加载到表中而不需要对数据进行转换,这样在处理海量数据时可以节省大量的时间。二、技术细节1、SerDe是Serialize/Deserilize的简称,目的是用于序列化和反序列化。2、用户在建表时可以用自定义的SerDe或使用Hive自带的SerD 阅读全文
阅读排行榜
Hadoop程序打印调试
2013-06-28 18:11 by java20130722, 690 阅读, 收藏,
摘要:
转载 Hadoop程序打印调试1. System.out 和 System.errMain在Main函数里使用System.out标准输出和System.err标准错误输出,输出定向到执行程序节点的终端上。即在完全分布的Hadoop部署中,输出会定向到启动程序的节点的终端上。Mapper针对每个split,会实例化一个Mapper对象作为一个task,在Hadoop集群中的某个机器中的某个Map槽上执行。Mapper对象中的map函数和configure函数会被主程序以RPC方式调用。因此,在Mapper对象中System.out和System.err输出的结果并不会定向到执行程序节点的终端. 阅读全文
手动安装cloudera cdh4.2 hadoop + hbase + hive(一)
2013-05-12 00:10 by java20130722, 677 阅读, 收藏,
摘要:
安装版本hadoop-2.0.0-cdh4.2.0
hbase-0.94.2-cdh4.2.0
hive-0.10.0-cdh4.2.0
jdk1.6.0_38
安装前说明安装目录为/opt检查hosts文件关闭防火墙设置时钟同步使用说明安装hadoop、hbase、hive成功之后启动方式为:启动dfs和mapreduce desktop1上执行start-dfs.sh和start-yarn.sh启动hbase desktop3上执行start-hbase.xml启动hive desktop1上执行hive规划 192.168.0.1 NameNode、Hive... 阅读全文
hive中select 走与不走mapreduce
2013-07-11 14:43 by java20130722, 671 阅读, 收藏,
摘要:
hive 0.10.0为了执行效率考虑,简单的查询,就是只是select,不带count,sum,group by这样的,都不走map/reduce,直接读取hdfs文件进行filter过滤。这样做的好处就是不新开mr任务,执行效率要提高不少,但是不好的地方就是用户界面不友好,有时候数据量大还是要等很长时间,但是又没有任何返回。改这个很简单,在hive-site.xml里面有个配置参数叫hive.fetch.task.conversion将这个参数设置为more,简单查询就不走map/reduce了,设置为minimal,就任何简单select都会走map/reduce 阅读全文
C# 实现 FTP 上传和下载功能
2013-03-17 22:20 by java20130722, 667 阅读, 收藏,
摘要:
using System;
using System.Collections.Generic;
using System.Web;
using System.Net;
using System.IO; namespace His.WebService.Utility
{ public class FtpHelper { /// /// ftp方式上传 /// public static int UploadFtp(string filePath, string filename, string ftpSe... 阅读全文
浙公网安备 33010602011771号