第三周进度报告
本周学习重心完全转移到 Hadoop 相关内容,前期收尾的 Web 项目已经归档完毕,不再占用学习时间,整体累计有效学习时长二十多小时,集群搭建、代码实操几个小时,调试配置、梳理理论知识点耗时十几个小时。
前三天我先完善 Linux 环境前置配置,完成 SSH 免密登录搭建,随后着手部署 Hadoop 伪分布式集群。这部分踩坑格外多,光是配置 core-site、hdfs-site 等核心文件就反复修改多次,一开始频繁出现 NameNode 格式化失败、端口占用的问题。最耗时的故障是启动集群后 DataNode 无法和主节点建立连接,我挨个核对防火墙状态、hosts 主机映射、文件夹读写权限,折腾一下午才定位到 hostname 配置不统一的根源,修复后集群终于完整启动。
集群跑通后,我开始实操 HDFS 命令行,练习文件上传、下载、查看数据分块、目录权限管理等基础操作。理论层面系统梳理 HDFS 整体架构,理清 NameNode、SecondaryNameNode、DataNode 各自职责,记录块存储机制、集群安全模式、HA 自动故障转移等核心知识点,把晦涩的分布式原理搭配实操案例理解记忆。
每天晚间会抽出一个半小时学习 Python 基础,练习列表、字典、文件读取等基础操作,提前积累文本处理能力,为之后信息化热词分类大作业铺垫基础。
下周计划深入学习 YARN 分布式调度框架,吃透资源调度完整工作流程;同时整理本周 Hadoop 配置参数笔记,方便后续查阅,持续保持 Python 日常练习节奏。本周最棘手的问题是 Hadoop 配置参数繁多,路径、端口任意一处写错都要重启整套集群测试,调试成本很高。下周我打算整理一份配置速查表,把高频参数统一记录,减少重复排错消耗的时间,提高大数据环境学习效率。

浙公网安备 33010602011771号