随笔分类 -  大数据

hadoop,spark,hive,impala,hbase,sqoop,kafka,elasticsearch。。。
第一章 Hue的安装
摘要:第一章 Hue的安装 === 1、Hue的介绍 === HUE= Hadoop User Experience ​ Hue是一个开源的Apache Hadoop UI系统,由Cloudera Desktop演化而来,最后Cloudera公司将其贡献给Apache基金会的Hadoop社区,它是基于Py 阅读全文

posted @ 2020-02-11 01:49 -小鱼- 阅读(711) 评论(0) 推荐(0)

集群一键启动/停止脚本
摘要:集群一键启动/停止脚本 === 1.集群一键启停脚本:mysh bash !/bin/bash 1 获取输入参数个数,如果没有参数,直接退出 p1=$1 p2=$2 user= FT= FT= ARGS_CONFIG=$FT/args_config.pro 获取参数 LINUX_VERSION= H 阅读全文

posted @ 2020-01-13 22:11 -小鱼- 阅读(903) 评论(0) 推荐(0)

第二章 impala基础使用
摘要:第二章 impala基本使用 === 1、impala的使用 === 1.1、impala shell语法 1.1.1、impala shell的外部命令参数语法 impala shell后面执行的时候可以带很多参数: h 查看帮助文档 r 刷新整个元数据,数据量大的时候,比较消耗服务器性能 B 去 阅读全文

posted @ 2019-08-27 00:15 -小鱼- 阅读(1542) 评论(0) 推荐(0)

Spark性能调优:广播大变量broadcast
摘要:Spark性能调优:广播大变量broadcast === 原文链接: 概要 有时在开发过程中,会遇到需要在算子函数中使用外部变量的场景(尤其是大变量,比如100M以上的大集合),那么此时就应该使用Spark的广播(Broadcast)功能来提升性能。 在算子函数中使用到外部变量时,默认情况下,Spa 阅读全文

posted @ 2019-08-26 11:34 -小鱼- 阅读(4819) 评论(0) 推荐(0)

nginx lua集成kafka
摘要:NGINX lua集成kafka === 第一步:进入opresty目录 说明:接下来我们关注两个目录 "lualib" 和 "nginx" ​ 1.lualib: 是存放opresty所需要的集成软件包的 ​ 2.nginx: 是nginx服务目录 接下来,我们进入lualib目录一看究竟: 这里 阅读全文

posted @ 2019-08-03 15:27 -小鱼- 阅读(1766) 评论(0) 推荐(0)

第一章 impala的安装
摘要:第一章 impala的安装 === 通过本地yum源进行安装impala 所有cloudera软件下载地址 [TOC] 1、impala的介绍 === imala基本介绍 ​ impala是cloudera提供的一款高效率的sql查询工具,提供实时的查询效果,官方测试性能比hive快10到100倍, 阅读全文

posted @ 2019-07-15 01:27 -小鱼- 阅读(4975) 评论(1) 推荐(1)

导航