11 2019 档案
摘要:一.Hadoop应用业务分析 大数据是不能用传统的计算技术处理的大型数据集的集合。它不是一个单一的技术或工具,而是涉及业务和技术的许多领域。 目前主流的三大分布式计算系统分别为Hadoop、Spark和Strom: Hadoop当前大数据管理标准之一,运用在当前很多商业应用系统。可以轻松地集成结构化
阅读全文
摘要:第一章 1.1流程 1.规划部署实施信息 1)规划程序安装路径 2)规划数据库实例数据存放路径 3)规划归档路径 4)规划备份路径 5)规划实例配置 2.使用安装包进行安装 3.创建实例数据库 1)配置库名 2)配置实例名 3)配置端口号 4)配置数据库参数 4.配置数据库 1)设置归档 2)设置定
阅读全文
摘要:一:环境的准备 本人用VMwareWorkstation虚拟机进行安装部署,准备镜像文件中标麒麟.iso 二:Neokylin Linux server 6.0上安装DM7企业版数据库 1.准备DM7安装包 dm7_setup_rh6_64_ent_7.6.0.142_20190312.iso 2.
阅读全文
摘要:这是mr的一种优化策略,通过压缩编码对mapper或者reducer的输出进行压缩,以减少磁盘io,提高mr运行速度(但也增加了cpu运算负担) 特性: 1.mr支持将map输出的结果或者reduce输出的结果进行压缩,以减少网络IO或最终输出数据的体积 2.压缩特性使用得当能提高性能,但运用不当也
阅读全文
摘要:Sqoop工具 1..协助RDBMS与Hadoop之间进行高效的大数据交流 把关系型数据库的数据导入Hadoop与其相关的系统(HBASE,HIVE) 同时也可以把数据从Hadoop系统抽取并导出到关系型数据库中。 Sqoop中一大亮点是可以通过Hadoop的mapreduce把数据从关系型数据库中
阅读全文
摘要:配置文件 agent.sources = r1 agent.sinks = k1 agent.channels = c1 ##sources config agent.sources.r1.type = org.apache.flume.source.kafka.KafkaSource agent.
阅读全文
摘要:查看kafka官网的userGuide 配置文件 agent.sources = r1 agent.sinks = k1 agent.channels = c1 ##sources config agent.sources.r1.type = org.apache.flume.source.kafk
阅读全文
摘要:查看kafka官网的userguide agent.sources = kafkaSource agent.channels = memoryChannel agent.sinks = hdfsSink agent.sources.kafkaSource.type = org.apache.flum
阅读全文
摘要:步骤一: 干净的集群,全新的hdfs 在第一台主机上配置配置文件 core-site.xml: <configuration> <property> <name>fs.defaultFS</name> <value>hdfs://bcqm1711</value> </property> <prope
阅读全文
摘要:安装MySQL; 1.检查当前环境是否安装mysql服务(命令:rpm -qa|grep -i mysql) 2.卸载自带的mysql 3.卸载软件:rpm -e --nodeps mysql-libs-5.5.71-1.el6.x86_64 4.安装mysql客户端与服务器 4.1下载依赖 sud
阅读全文