10 2015 档案

摘要:大数据最烦的就是数据质量差,为了把数据导入到sequoiadb中,需要要求文本是UTF-8模式的,使用enca查看文件编码是gb2312,然后是enca转utf-8报错。google了整个地球都不知道原因,尝试使用python进行转码# -*- coding: utf-8 -*-import cod... 阅读全文
posted @ 2015-10-28 18:12 高兴的博客 阅读(2066) 评论(1) 推荐(0)
摘要:Spark作为一个新的分布式计算引擎正慢慢流行起来,越来越来的企业也准备用它的替换MapReduce,根据自己在工作的一些体会谈谈的优势。 分布式计算归根到底还是一个Map和Reduce操作,Map操作对每个数据块进行计算,Reduce操作对结果进行汇总,现在一些NoSQL分布式数据库其实也是这么一 阅读全文
posted @ 2015-10-28 11:28 高兴的博客 阅读(2174) 评论(0) 推荐(1)
摘要:1:map和模式匹配的结合 2:map转成array 阅读全文
posted @ 2015-10-25 19:53 高兴的博客 阅读(1334) 评论(0) 推荐(0)
摘要:Spark序列化这块网上讲的比较少,自己还没来得及看这块代码,今天编程的时候遇到一个Hadoop的Writerable实现在Spark无法序列化的问题。我的代码如下: 这块代码执行报了如下错误。 因为Spark默认使用Java的序列化,而Writeable没有实现序列化接口,导致整个问题的发生。通过 阅读全文
posted @ 2015-10-23 14:28 高兴的博客 阅读(890) 评论(0) 推荐(0)