10 2015 档案
摘要:大数据最烦的就是数据质量差,为了把数据导入到sequoiadb中,需要要求文本是UTF-8模式的,使用enca查看文件编码是gb2312,然后是enca转utf-8报错。google了整个地球都不知道原因,尝试使用python进行转码# -*- coding: utf-8 -*-import cod...
阅读全文
摘要:Spark作为一个新的分布式计算引擎正慢慢流行起来,越来越来的企业也准备用它的替换MapReduce,根据自己在工作的一些体会谈谈的优势。 分布式计算归根到底还是一个Map和Reduce操作,Map操作对每个数据块进行计算,Reduce操作对结果进行汇总,现在一些NoSQL分布式数据库其实也是这么一
阅读全文
摘要:1:map和模式匹配的结合 2:map转成array
阅读全文
摘要:Spark序列化这块网上讲的比较少,自己还没来得及看这块代码,今天编程的时候遇到一个Hadoop的Writerable实现在Spark无法序列化的问题。我的代码如下: 这块代码执行报了如下错误。 因为Spark默认使用Java的序列化,而Writeable没有实现序列化接口,导致整个问题的发生。通过
阅读全文

浙公网安备 33010602011771号