03 2016 档案

摘要:目前,我要对一个hive表进行处理,主要是对每一个day分区的数据进行处理,我写了一个shell脚本循环的调用对分区数据进行筛选 代码很简单: 但是,我跑一年的数据需要好久,后来我想数据之间又没有什么关系,我应该启个多线程去执行啊,本着学习的态度搜索了下,发现了其实在后面加入&就可以放在后台中执行, 阅读全文
posted @ 2016-03-25 19:48 dalu610 阅读(1537) 评论(0) 推荐(0)
摘要:tr: tr命令不接受指定的文件参数,而是对标准输入进行编译 使用主要是 tr SET1 SET2 例如 tr ' ' '\11' <height.txt (使用ascii的八进制标示,制表符11,回车15,换行12) tr转换大小写 tr 'a-z' 'A-Z' <word.txt numbers 阅读全文
posted @ 2016-03-22 18:00 dalu610 阅读(305) 评论(0) 推荐(0)
摘要:在统计学和机器学习中,ensemble methods(集成学习方法)使用多个学习算法来获取更好的预测表现相比组成他的所有学习方法。 一个机器学习的集成方法通常指一个具体的有限的替代模型集合,但通常允许更加灵活的数据结构存在 监督学习(Supervised learning)算法通常被描述为探索一个 阅读全文
posted @ 2016-03-18 16:22 dalu610 阅读(251) 评论(0) 推荐(0)
摘要:Gradient boostin是一个机器学习技术,可以用来分类和线性回归。通过集成一些弱的预测模型来生成一个预测模型。通常是决策树。 它像其他boosting方法一样通过阶段性的建立模型。它允许对可微的损失函数的优化。 阅读全文
posted @ 2016-03-18 14:42 dalu610 阅读(127) 评论(0) 推荐(0)
摘要:package com.elong; import org.apache.hadoop.io.Text; import org.apache.hadoop.io.WritableComparable; import java.io.DataInput; import java.io.DataOutp 阅读全文
posted @ 2016-03-17 16:19 dalu610 阅读(463) 评论(0) 推荐(0)
摘要:org.apache.hadoop.io包包含了6个Writable collection类型: ArrayWritable,TwoDArrayWritable是Writable实现了数组和二维数组的实例。所有的元素都必须是一个相同类的实例: ArrayWritable writable = new ArrayWritable(Text.class); ArrayPrimitiveWri... 阅读全文
posted @ 2016-03-17 15:07 dalu610 阅读(161) 评论(0) 推荐(0)
摘要:import java.io.DataInput; import java.io.DataOutput; import java.io.IOException; /** * Created by user on 16/3/17. */ public interface Writable { void write(DataOutput out) throws IOException;... 阅读全文
posted @ 2016-03-17 11:45 dalu610 阅读(285) 评论(0) 推荐(0)
摘要: 阅读全文
posted @ 2016-03-16 20:48 dalu610 阅读(157) 评论(0) 推荐(0)
摘要:hadoop跑的是MapReduce job 而对于storm集群跑的是拓扑任务,MapReduce任务可以完成,但一个拓扑任务会一直进行下去,除非你kill它。 storm也有master和work节点,master叫Nimbus,work节点称之为Supervisor。 storm的核心抽象时流,流是一个无界的元组序列。storm提供原函数(primitives)操作,可靠的分布式的使一个... 阅读全文
posted @ 2016-03-16 16:34 dalu610 阅读(146) 评论(0) 推荐(0)
摘要:事务(Transaction)是数据库区别文件系统的重要特性之一。 事务会吧数据从一种一致的状态转换为另一种一致的状态。要么修改都保存,要么都不保存 事务完全符合ACID的特性: 原子性(atomicity),整个数据库事务是不可分割的工作单位。 一致性(consistency) 隔离性(isola 阅读全文
posted @ 2016-03-09 10:34 dalu610 阅读(128) 评论(0) 推荐(0)
摘要:一直对序列化这块比较迷糊,也比较感兴趣。 序列化(Serialization)是将结构化对象转换为字节流数据用来在网络中传输,或者写到持久话存储(persistent storage)。 反序列化(Deserialization)是一个相反的过程,将字节流数据转换为一系列的结构化对象。(这点,一直不 阅读全文
posted @ 2016-03-07 19:20 dalu610 阅读(307) 评论(0) 推荐(0)
摘要:Hadoop配备了一套的基本数据I/O操作,例如数据的压缩,数据完成行。但由于需要考虑大数据的问题,hadoop也自己开发了例如序列化框架,在磁盘的数据结构 数据完整性,通常使用计算一个checksum,在原始数据和之后的数据传输中,通常使用CRC-32,HDFS使用更高效的方法CRC-32C 在h 阅读全文
posted @ 2016-03-04 19:24 dalu610 阅读(203) 评论(0) 推荐(0)
摘要:理想的世界,一个YARN应用请求将会立刻得到授予。而现实世界,资源是受限制的,在一个忙碌的集群中,一个应用经常需要等待他请求的资源。YARN调度负责这个事情,分配资源给应用通过一些方式定义。调度是一个困难的问题也没有所谓最好的方法。 YARN有三种调度,FIFO,Capacity,Fair Sche 阅读全文
posted @ 2016-03-04 15:35 dalu610 阅读(239) 评论(0) 推荐(0)
摘要:https://www.kaggle.com/omarelgabry/titanic/a-journey-through-titanic/discussion 这个是个很不错的python方法,下面的我也参与了讨论。 Hi, Why did you drop dummy_variables for 阅读全文
posted @ 2016-03-04 10:46 dalu610 阅读(334) 评论(0) 推荐(0)
摘要:可扩展性:与jobtracker相反,每一个应用实例,这里可以说是一个MapReduce job有一个转有的应用管理,在应用执行期间运行。这个模型更靠近原始的google论文。 高可用:高可用(High availability)通常是在服务进程失败后,另一个守护进程(daemon)能够复制状态并且 阅读全文
posted @ 2016-03-03 17:58 dalu610 阅读(165) 评论(0) 推荐(0)
摘要:YARN(Yet Another Resource Negotiator)通过两类长期运行的守护进程(daemon)提供核心服务,a resource manager(每一个集群只有一个)来管理集群资源,node manager在集群中所有节点上运行,启动和监控容器。一个容器运行一个特别的应用进程, 阅读全文
posted @ 2016-03-03 17:07 dalu610 阅读(281) 评论(0) 推荐(0)
摘要:当前块被写入时,对于其他用户是不可见的。hflush()可以保证所有的datenode被写上去。 hflush()和hsync()方法都是有一定高消耗,但是可以防止数据的丢失,这是一种在数据的鲁棒性(robustness)和吞吐量(throughput)的权衡。这是根据不同的应用决定的. 阅读全文
posted @ 2016-03-03 15:03 dalu610 阅读(141) 评论(0) 推荐(0)
摘要:如图中所示,很多次听别人讲文件读写时,都没有说清楚那3个备份到底是如何完成的,从图中可以看出,客户端第一步调取call()方法在DistributedFileSystem,DistributedFileSystem使用RPC连接namenode来创建一个新的文件,并没有分配块。namenode检查文 阅读全文
posted @ 2016-03-03 12:12 dalu610 阅读(449) 评论(0) 推荐(0)
摘要:HDFS建立在大多数高效的数据处理模式都是一次写入,多次读取。 每次数据的读取,都会涉及到一个相当大的比例,因此读取整个数据的时间远远比读取第一份数据的延迟更重要。 namenode知道块在哪个datenode上,但不知道块的后续位置。 namenode失效的话,整个文件系统将会无法使用,因此对na 阅读全文
posted @ 2016-03-02 20:23 dalu610 阅读(148) 评论(0) 推荐(0)
摘要:MapReduce是一个处理数据的项目模型。Hadoop可以通过多个语言来写MapReduce项目。MapReduce是天生并行(inherently parallel)的。 为什么说这个天气数据集是非常好的candidate对于MapReduce,其中提到的两个特征:半结构化(semi-struc 阅读全文
posted @ 2016-03-02 15:09 dalu610 阅读(134) 评论(0) 推荐(0)