随笔分类 -
大数据
hadoop,spark,hive,impala,hbase,sqoop,kafka,elasticsearch。。。
摘要:第一章 Hue的安装 === 1、Hue的介绍 === HUE= Hadoop User Experience Hue是一个开源的Apache Hadoop UI系统,由Cloudera Desktop演化而来,最后Cloudera公司将其贡献给Apache基金会的Hadoop社区,它是基于Py
阅读全文
摘要:集群一键启动/停止脚本 === 1.集群一键启停脚本:mysh bash !/bin/bash 1 获取输入参数个数,如果没有参数,直接退出 p1=$1 p2=$2 user= FT= FT= ARGS_CONFIG=$FT/args_config.pro 获取参数 LINUX_VERSION= H
阅读全文
摘要:第二章 impala基本使用 === 1、impala的使用 === 1.1、impala shell语法 1.1.1、impala shell的外部命令参数语法 impala shell后面执行的时候可以带很多参数: h 查看帮助文档 r 刷新整个元数据,数据量大的时候,比较消耗服务器性能 B 去
阅读全文
摘要:Spark性能调优:广播大变量broadcast === 原文链接: 概要 有时在开发过程中,会遇到需要在算子函数中使用外部变量的场景(尤其是大变量,比如100M以上的大集合),那么此时就应该使用Spark的广播(Broadcast)功能来提升性能。 在算子函数中使用到外部变量时,默认情况下,Spa
阅读全文
摘要:NGINX lua集成kafka === 第一步:进入opresty目录 说明:接下来我们关注两个目录 "lualib" 和 "nginx" 1.lualib: 是存放opresty所需要的集成软件包的 2.nginx: 是nginx服务目录 接下来,我们进入lualib目录一看究竟: 这里
阅读全文
摘要:第一章 impala的安装 === 通过本地yum源进行安装impala 所有cloudera软件下载地址 [TOC] 1、impala的介绍 === imala基本介绍 impala是cloudera提供的一款高效率的sql查询工具,提供实时的查询效果,官方测试性能比hive快10到100倍,
阅读全文