Fork me on GitHub

随笔分类 -  大数据

摘要:MapReduce计算框架各个步骤详解(主要是Shuffle) - CSDN博客最近经历的一些大数据(Spark/Hadoop)面试题 - CSDN博客最新大数据hadoop、spark等面试题汇总-面试题-about云开发-活到老 学到老HDFS文件读写及准确性介绍-大数据学习-about云开发-活到老 学到老深度了解namenode-其 内部关键数据结构原理简介-大数据学习-about云开... 阅读全文
posted @ 2018-09-04 17:16 迁梦余光 阅读(266) 评论(0) 推荐(0)
摘要: 阅读全文
posted @ 2018-08-12 22:18 迁梦余光 阅读(106) 评论(0) 推荐(0)
摘要:Spark的安装与部署 Spark的安装部署方式有以下几种模式 Standalone YARN Mesos Amazon EC2 伪分布式部署 配置:conf/spark-env.sh vim conf/spark-env.sh # 配置jdk export JAVA_HOME=/root/trai 阅读全文
posted @ 2018-07-15 15:42 迁梦余光 阅读(396) 评论(0) 推荐(0)
摘要:1、编程模型 2、Worker通信机制 阅读全文
posted @ 2018-07-14 09:26 迁梦余光 阅读(187) 评论(0) 推荐(0)
摘要:配置zookeeper 下载zookeeper tar包 解压:tar -zxvf zookeeper-3.4.10.tar.gz -C /root/training/ 配置 cd /root/training/zookeeper-3.4.10/conf mv zoo_sample.cfg zoo. 阅读全文
posted @ 2018-07-14 00:04 迁梦余光 阅读(775) 评论(0) 推荐(0)
摘要:起初搭建Hadoop集群时确实相当麻烦,针对Hadoop生态中各个组件还需要考虑版本的兼容,调整诸多配置项,稍不留神就要折腾半天;有痛点就有相应的技术方案, Ambari的诞生方便了我们对整个Hadoop集群的创建、管理、监视。 Centos7制作Ambari本地源并安装 阅读全文
posted @ 2018-07-10 09:13 迁梦余光 阅读(171) 评论(0) 推荐(0)
摘要:Hadoop分支 Apache Cloudera Hortonworks 本文是采用Cloudera分支的hadoop。 下载cdh-5.3.6 版本 下载地址:http://archive.cloudera.com/cdh5/cdh/5/ 各组件版本一定保持一致。 cdh5.3.6-snappy- 阅读全文
posted @ 2018-05-27 21:02 迁梦余光 阅读(251) 评论(0) 推荐(0)
摘要:Sqoop http://sqoop.apache.org/docs/1.4.6/SqoopUserGuide.html#_introduction Flume http://flume.apache.org/documentation.html Oozie http://oozie.apache. 阅读全文
posted @ 2018-05-20 20:52 迁梦余光 阅读(203) 评论(0) 推荐(0)
摘要:HiveServer2 https://cwiki.apache.org/confluence/display/Hive/HiveServer2+Overview2 https://cwiki.apache.org/confluence/display/Hive/HiveServer2+Client 阅读全文
posted @ 2018-05-13 09:11 迁梦余光 阅读(175) 评论(0) 推荐(0)
摘要:如何用形象的比喻描述大数据的技术生态?Hadoop、Hive、Spark 之间是什么关系? https://www.zhihu.com/question/27974418 HBase 和 Hive 的差别是什么,各自适用场景? https://www.zhihu.com/question/21677 阅读全文
posted @ 2018-05-06 18:16 迁梦余光 阅读(103) 评论(0) 推荐(0)
摘要:Hive表的创建和数据类型 https://cwiki.apache.org/confluence/display/Hive/Home 管理表和外部的区别 分区表创建及查询 分区表实际上就是对应一个HDFS文件系统上的独立的文件夹,该文件夹下是该分区所有的数据文件。Hive中的分区就是分目录,把一个 阅读全文
posted @ 2018-05-06 17:30 迁梦余光 阅读(372) 评论(0) 推荐(0)
摘要:hive 常用的几种shell交互方式 查看hive命令帮助:bin/hive -help 不进入hive shell交互界面,直接执行: 把sql脚本写入文件,通过 bin/hive -f 加载并执行脚本文件;通过bin/hive -f /opt/datas/hivef.sql > /opt/da 阅读全文
posted @ 2018-05-06 11:13 迁梦余光 阅读(589) 评论(0) 推荐(0)
摘要: 阅读全文
posted @ 2018-04-30 08:56 迁梦余光 阅读(112) 评论(0) 推荐(0)
摘要:表的rowkey设计核心思想: 预分区创建的三种方式 tail -f 在命令列控制窗口中使用 tail -f,它将会以一定的时间实时追踪. 基于SQL语法查询HBase Phoenix实现用SQL查询HBase hbase二级索引 使用solr构建hbase二级索引: https://www.cnb 阅读全文
posted @ 2018-04-22 18:08 迁梦余光 阅读(364) 评论(0) 推荐(0)
摘要:下载安装包 我使用的是:hbase-0.99.2-bin.tar.gz 上传到指定目录:个人习惯,我放在了/home/hadoop/apps/ 解压 重命名 修改环境变量 在node1机器上执行下面命令 添加内容: 使其立即生效: 同样在其他机器上也执行上述操作。 修改配置文件 hbase-env. 阅读全文
posted @ 2018-04-09 22:45 迁梦余光 阅读(149) 评论(0) 推荐(0)
摘要:1、Hive不支持记录级别的更新、插入或删除? 2、sort by 和 order by 的区别? https://blog.csdn.net/jthink_/article/details/38903775 3、分区和分桶的区别? 分区:是hive中对数据比较粗粒度的划分,每个分区对应一个文件目录 阅读全文
posted @ 2018-03-21 08:59 迁梦余光 阅读(143) 评论(0) 推荐(0)
摘要:Hive是什么? 由Facebook开源用于解决海量 结构化日志的数据统计; Hive是基于Hadoop的一个 数据仓库工具,可以将结构化的数据文件映射 成一张表,并提供类SQL查询功能; 构建在Hadoop 之上的数据仓库; 1. 使用HQL作为查询接口; 2. 使用HDFS存储; 3. 使用Ma 阅读全文
posted @ 2018-03-17 19:00 迁梦余光 阅读(292) 评论(0) 推荐(0)
摘要:动态添加 DataNode 节点 hadoop环境是必须的 需要加入新的 DataNode 节点,前提是已经配置好 SSH 无密登录;直接复制已有DataNode中.ssh目录中的authorizedkeys和idrsa。 在新DataNode上启动hadoop hadoop-daemon.sh s 阅读全文
posted @ 2018-03-17 13:23 迁梦余光 阅读(369) 评论(0) 推荐(0)
摘要:http://blog.csdn.net/yczws1/article/details/21899007 阅读全文
posted @ 2018-01-23 09:04 迁梦余光 阅读(135) 评论(0) 推荐(0)
摘要:1、配置ssh免登陆 3.安装hadoop2.8.3先上传hadoop的安装包到服务器上去/home/hadoop/ 本地模式 wget http://mirror.bit.edu.cn/apache/hadoop/common/hadoop-2.8.3/hadoop-2.8.3.tar.gz #解 阅读全文
posted @ 2018-01-14 10:05 迁梦余光 阅读(214) 评论(0) 推荐(0)