7/18
本周是暑假正式投入技术学习的第一周,我按照PPT中的大数据路线图,从Linux Shell脚本和Hadoop基础环境入手,逐步搭建起学习框架。在Shell脚本方面,我系统学习了变量定义、运算符使用、环境变量设置以及各类条件判断和循环语句,包括if、case、for和while,为了巩固理解,我手写了12个小脚本,涉及文件批量重命名、日志按日期归档等实用功能。Hadoop方面,我完成了伪分布式环境的搭建,配置SSH免密登录时反复折腾了权限问题,最终通过修改.ssh目录和authorized_keys文件的权限为600才成功,随后顺利跑通了经典的WordCount示例,看到控制台输出结果时挺有成就感。HDFS文档的NameNode和DataNode原理部分我也认真通读了,对镜像文件和编辑日志的概念有了初步印象。汇总本周的时间投入,总学习时长约14小时,其中纯代码编写和调试占了6小时,而解决各类配置报错、路径权限、环境变量缺失等问题用掉了2.5小时,这些踩坑经历虽然耗时,但让我对Linux权限和Hadoop启动流程有了更深刻的理解。目前的主要困惑集中在两点:一是Shell脚本中[ ]和[[ ]]的适用场景区分不清,导致条件判断偶尔失效,查阅资料后决定统一改用[[ ]]增强可读性;二是对HDFS块大小调整的实际影响把握不准,需要进一步学习集群配置的优先级规则。下周我将跨入完全分布式集群的搭建,准备用三台虚拟机模拟真实生产环境,同时深入学习HDFS的FsImage和Edits Log机制,并尝试改写WordCount程序加入自定义计数器功能。

浙公网安备 33010602011771号