09 2021 档案

摘要:具体 Shuffle 过程详解,如下: (1)MapTask 收集我们的 map()方法输出的 kv 对,放到内存缓冲区中 (2)从内存缓冲区不断溢出本地磁盘文件,可能会溢出多个文件 (3)多个溢出文件会被合并成大的溢出文件 (4)在溢出过程及合并的过程中,都要调用 Partitioner 进行分区 阅读全文
posted @ 2021-09-30 22:53 宋振兴 阅读(101) 评论(0) 推荐(0)
摘要:今天我来学习这个TextInputFormat。则个玩意属于在大数据的基础中 1)FileInputFormat 实现类 思考:在运行 MapReduce 程序时,输入的文件格式包括:基于行的日志文件、二进制 格式文件、数据库表等。那么,针对不同的数据类型,MapReduce 是如何读取这些数据的呢 阅读全文
posted @ 2021-09-29 22:47 宋振兴 阅读(58) 评论(0) 推荐(0)
摘要:今天我想要好好的学习一手别的东西。 一定会好好学习别的东西的。 暂时停止一下大数据相关内容的学习。 阅读全文
posted @ 2021-09-28 22:42 宋振兴 阅读(26) 评论(0) 推荐(0)
摘要:今天学习MapReduce 框架原理 nputFormat 数据输入 3.1.1 切片与 MapTask 并行度决定机制 1)问题引出 MapTask 的并行度决定 Map 阶段的任务处理并发度,进而影响到整个 Job 的处理速度。 思考:1G 的数据,启动 8 个 MapTask,可以提高集群的并 阅读全文
posted @ 2021-09-27 22:22 宋振兴 阅读(48) 评论(0) 推荐(0)
摘要:今天我完成一个Bean序列化实例 package com.atguigu.mapreduce.writable; import org.apache.hadoop.io.Writable; import java.io.DataInput; import java.io.DataOutput; im 阅读全文
posted @ 2021-09-26 21:13 宋振兴 阅读(54) 评论(0) 推荐(0)
摘要:今天学习雅恩相关的知识点。 (1)MR 程序提交到客户端所在的节点。 (2)YarnRunner 向 ResourceManager 申请一个 Application。 (3)RM 将该应用程序的资源路径返回给 YarnRunner。 (4)该程序将运行所需资源提交到 HDFS 上。 (5)程序资源 阅读全文
posted @ 2021-09-25 22:28 宋振兴 阅读(92) 评论(0) 推荐(0)
摘要:今天我学习hadoop 的序列化相关知识点。 2.1 序列化概述 1)什么是序列化 序列化就是把内存中的对象,转换成字节序列(或其他数据传输协议)以便于存储到磁 盘(持久化)和网络传输。 反序列化就是将收到字节序列(或其他数据传输协议)或者是磁盘的持久化数据,转换 成内存中的对象。 2)为什么要序列 阅读全文
posted @ 2021-09-24 22:25 宋振兴 阅读(52) 评论(0) 推荐(0)
摘要:今天我偷懒了一天,啥也没有学习,哎。偷偷记上。 阅读全文
posted @ 2021-09-23 22:23 宋振兴 阅读(23) 评论(0) 推荐(0)
摘要:这个项目的最后的运行。 修改不带依赖的 jar 包名称为 wc.jar,并拷贝该 jar 包到 Hadoop 集群的 /opt/module/hadoop-3.1.3 路径。 ( 启动 Hadoop 集群 [atguigu@hadoop102 hadoop-3.1.3]sbin/start-dfs. 阅读全文
posted @ 2021-09-22 22:19 宋振兴 阅读(61) 评论(0) 推荐(0)
摘要:我昨天在idea中用的那个依赖,所对应的代码,这直接粘贴过来了,不知道为啥,省略没了。 package com.atguigu.mapreduce.wordcount; import java.io.IOException; import org.apache.hadoop.io.IntWritab 阅读全文
posted @ 2021-09-21 22:16 宋振兴 阅读(43) 评论(0) 推荐(0)
摘要:今天我顺便学习了idea,知道了原来可以直接加依赖就可以编程。太方便了。这是想要连接mapreduce的依赖群体。 <dependencies> <dependency> <groupId>org.apache.hadoop</groupId> <artifactId>hadoop-client</ 阅读全文
posted @ 2021-09-20 22:14 宋振兴 阅读(40) 评论(0) 推荐(0)
摘要:今天学习mapreduce的相关东西,这是我看的别人的总结。 1.Mapper阶段 (1)用户自定义的Mapper要继承自己的父类 (2)Mapper的输入数据是KV对的形式(KV的类型可自定义) (3)Mapper中的业务逻辑写在map()方法中 (4)Mapper的输出数据是KV对的形式(KV的 阅读全文
posted @ 2021-09-19 22:10 宋振兴 阅读(35) 评论(0) 推荐(0)
摘要:今天我学习了Hadoop的基础操作。 顺便,今天是9.18,为我们这个民族默哀,默哀一下。 这是关于hadoop中Hdfs的操作。 [song@hadoop102 hadoop-3.1.3]$ bin/hadoop fs [-appendToFile <localsrc> ... <dst>] [- 阅读全文
posted @ 2021-09-18 21:04 宋振兴 阅读(32) 评论(0) 推荐(0)
摘要:今天我要展示一下我昨天的劳动成果。 hdfs中有以下的文件。我想我的操作还是可以的,没有什么错误 阅读全文
posted @ 2021-09-17 21:55 宋振兴 阅读(39) 评论(0) 推荐(0)
摘要:今天进行了对于hadoop的基础测试。 以下是测试的题目。 测试题目1: Hadoop操作 使用hadoop用户登录Linux系统,启动Hadoop(Hadoop的安装目录为“/usr/local/hadoop”),为hadoop用户在HDFS中创建用户目录“/user/hadoop” 接着在HDF 阅读全文
posted @ 2021-09-16 21:51 宋振兴 阅读(131) 评论(0) 推荐(0)
摘要:今天我要完成这个项目了,明天再不把hadoop配置好就完蛋了。 这是我这个项目的一部分的截图,应该是写完了。 阅读全文
posted @ 2021-09-15 21:48 宋振兴 阅读(37) 评论(0) 推荐(0)
摘要:今天继续做那个web项目,但是我好像不是很明白该如何去做了。各个部分之间的关系,不是很明确,只说明我最基础的东西都非常的不扎实,这是非常要命的。 阅读全文
posted @ 2021-09-14 21:08 宋振兴 阅读(29) 评论(0) 推荐(0)
摘要:前段时间老师突然进行了一波javaweb的前台增删改查的练习。我一直没有好好完成,今明两天我决定完成一下。毕竟,hadoop那个还有一些些时间,我还有操作的空间和机会。 给项目一个截图。 阅读全文
posted @ 2021-09-13 21:06 宋振兴 阅读(35) 评论(0) 推荐(0)
摘要:今天完成脚本的配置,可以让我更快的启动我们的hadoop 操作更加的便捷。 Hadoop 集群启停脚本(包含 HDFS,Yarn,Historyserver):myhadoop.sh [atguigu@hadoop102 ~]$ cd /home/atguigu/bin [atguigu@hadoo 阅读全文
posted @ 2021-09-12 20:32 宋振兴 阅读(100) 评论(0) 推荐(0)
摘要:今天我在测试上传文件到集群: (1)上传小文件 [atguigu@hadoop102 ~]$ hadoop fs -mkdir /input [atguigu@hadoop102 ~]$ hadoop fs -put $HADOOP_HOME/wcinput/word.txt /input 上传大文 阅读全文
posted @ 2021-09-11 09:54 宋振兴 阅读(51) 评论(0) 推荐(0)
摘要:今天我要配置文件环境,这玩意赔了这么多天我是没想到的。这着实有一点超出了我的意料。 这是hdfs-site.xml文件。我截图截来证明一下我不是在偷懒,只是在好好的配置环境。 尚硅谷中有很详细的配置环境,想要去看的,可以去搜一下,非常的好用,非常的称职的教学团体。 阅读全文
posted @ 2021-09-10 21:23 宋振兴 阅读(33) 评论(0) 推荐(0)
摘要:集群部署规划 注意:NameNode 和 SecondaryNameNode 不要安装在同一台服务器.ResourceManager 也很消耗内存,不要和 NameNode、SecondaryNameNode 配置在 同一台机器上。 这样配置之后,只需要进行文件的配置就好了。 阅读全文
posted @ 2021-09-09 20:45 宋振兴 阅读(34) 评论(0) 推荐(0)
摘要:今天我进行了hadoop的环境配置,昨天我已经把虚拟机环境搭载完毕,将hadoop的相关软件下载完毕,这是必要的操作,今天就进行了相关的配置。 真的很长啊。 这是我虚拟机的截图,明天再进行更多的配置吧,今天就下机了。 。 阅读全文
posted @ 2021-09-08 20:34 宋振兴 阅读(38) 评论(0) 推荐(0)
摘要:今天是开学的第一篇博客,建民老师已经要求我们对于hadoop进行了一波学习,但是我的暑假过的并不是那么的充实,所以学习hadoop,还是要从现在开始。 暑假期间我找到了尚硅谷的视频,以及他的相关资料也已经下载到了手中,资源有了,那么那就好说了。再过两天,建民就要我们对mapreduce进行操作了。 阅读全文
posted @ 2021-09-07 21:23 宋振兴 阅读(48) 评论(0) 推荐(0)