随笔分类 - 大数据
摘要:MapReduce计算框架各个步骤详解(主要是Shuffle) - CSDN博客最近经历的一些大数据(Spark/Hadoop)面试题 - CSDN博客最新大数据hadoop、spark等面试题汇总-面试题-about云开发-活到老 学到老HDFS文件读写及准确性介绍-大数据学习-about云开发-活到老 学到老深度了解namenode-其 内部关键数据结构原理简介-大数据学习-about云开...
阅读全文
摘要:Spark的安装与部署 Spark的安装部署方式有以下几种模式 Standalone YARN Mesos Amazon EC2 伪分布式部署 配置:conf/spark-env.sh vim conf/spark-env.sh # 配置jdk export JAVA_HOME=/root/trai
阅读全文
摘要:配置zookeeper 下载zookeeper tar包 解压:tar -zxvf zookeeper-3.4.10.tar.gz -C /root/training/ 配置 cd /root/training/zookeeper-3.4.10/conf mv zoo_sample.cfg zoo.
阅读全文
摘要:起初搭建Hadoop集群时确实相当麻烦,针对Hadoop生态中各个组件还需要考虑版本的兼容,调整诸多配置项,稍不留神就要折腾半天;有痛点就有相应的技术方案, Ambari的诞生方便了我们对整个Hadoop集群的创建、管理、监视。 Centos7制作Ambari本地源并安装
阅读全文
摘要:Hadoop分支 Apache Cloudera Hortonworks 本文是采用Cloudera分支的hadoop。 下载cdh-5.3.6 版本 下载地址:http://archive.cloudera.com/cdh5/cdh/5/ 各组件版本一定保持一致。 cdh5.3.6-snappy-
阅读全文
摘要:Sqoop http://sqoop.apache.org/docs/1.4.6/SqoopUserGuide.html#_introduction Flume http://flume.apache.org/documentation.html Oozie http://oozie.apache.
阅读全文
摘要:HiveServer2 https://cwiki.apache.org/confluence/display/Hive/HiveServer2+Overview2 https://cwiki.apache.org/confluence/display/Hive/HiveServer2+Client
阅读全文
摘要:如何用形象的比喻描述大数据的技术生态?Hadoop、Hive、Spark 之间是什么关系? https://www.zhihu.com/question/27974418 HBase 和 Hive 的差别是什么,各自适用场景? https://www.zhihu.com/question/21677
阅读全文
摘要:Hive表的创建和数据类型 https://cwiki.apache.org/confluence/display/Hive/Home 管理表和外部的区别 分区表创建及查询 分区表实际上就是对应一个HDFS文件系统上的独立的文件夹,该文件夹下是该分区所有的数据文件。Hive中的分区就是分目录,把一个
阅读全文
摘要:hive 常用的几种shell交互方式 查看hive命令帮助:bin/hive -help 不进入hive shell交互界面,直接执行: 把sql脚本写入文件,通过 bin/hive -f 加载并执行脚本文件;通过bin/hive -f /opt/datas/hivef.sql > /opt/da
阅读全文
摘要:表的rowkey设计核心思想: 预分区创建的三种方式 tail -f 在命令列控制窗口中使用 tail -f,它将会以一定的时间实时追踪. 基于SQL语法查询HBase Phoenix实现用SQL查询HBase hbase二级索引 使用solr构建hbase二级索引: https://www.cnb
阅读全文
摘要:下载安装包 我使用的是:hbase-0.99.2-bin.tar.gz 上传到指定目录:个人习惯,我放在了/home/hadoop/apps/ 解压 重命名 修改环境变量 在node1机器上执行下面命令 添加内容: 使其立即生效: 同样在其他机器上也执行上述操作。 修改配置文件 hbase-env.
阅读全文
摘要:1、Hive不支持记录级别的更新、插入或删除? 2、sort by 和 order by 的区别? https://blog.csdn.net/jthink_/article/details/38903775 3、分区和分桶的区别? 分区:是hive中对数据比较粗粒度的划分,每个分区对应一个文件目录
阅读全文
摘要:Hive是什么? 由Facebook开源用于解决海量 结构化日志的数据统计; Hive是基于Hadoop的一个 数据仓库工具,可以将结构化的数据文件映射 成一张表,并提供类SQL查询功能; 构建在Hadoop 之上的数据仓库; 1. 使用HQL作为查询接口; 2. 使用HDFS存储; 3. 使用Ma
阅读全文
摘要:动态添加 DataNode 节点 hadoop环境是必须的 需要加入新的 DataNode 节点,前提是已经配置好 SSH 无密登录;直接复制已有DataNode中.ssh目录中的authorizedkeys和idrsa。 在新DataNode上启动hadoop hadoop-daemon.sh s
阅读全文
摘要:http://blog.csdn.net/yczws1/article/details/21899007
阅读全文
摘要:1、配置ssh免登陆 3.安装hadoop2.8.3先上传hadoop的安装包到服务器上去/home/hadoop/ 本地模式 wget http://mirror.bit.edu.cn/apache/hadoop/common/hadoop-2.8.3/hadoop-2.8.3.tar.gz #解
阅读全文

浙公网安备 33010602011771号