7/25

本周的学习重心完全押在了HDFS分布式文件系统的深度实践上,我利用三台CentOS虚拟机完成了完全分布式集群的安装配置,核心工作集中在core-site.xml和hdfs-site.xml的参数调优,尤其是namenode和datanode的数据目录指定、副本数设置以及secondarynamenode的检查点周期。在实际操作中,我模拟了SecondaryNameNode的检查点合并过程,观察了edits_inprogress文件如何滚动生成新的fsimage,同时手工模拟了一次NameNode故障,通过恢复元数据让集群重新上线,这个过程让我对HA机制的必要性有了切身体会。为了提升运维效率,我还编写了5个Shell自动化脚本,用于批量启动停止服务、定时清理日志和监控磁盘使用率,这些脚本在日常调试中节省了不少重复劳动。时间统计方面,本周总学习时长约为15小时,代码及配置文件修改占7小时,而排障环节消耗了约3小时,主要卡在两个地方:一是防火墙未开放8020和9000端口导致DataNode无法注册,二是JournalNode节点之间的同步延迟造成HA切换失败,后来发现是zkfc配置中遗漏了zookeeper.quorum参数,补上后故障转移恢复正常。虚拟机磁盘空间不足的问题也在本周浮出水面,我通过LVM在线扩容解决了DataNode写入失败的错误。目前对JournalNode的多数派写入机制理解仍停留在概念层面,下周我打算将注意力转移到Yarn资源调度和MapReduce编程实战,同时为PPT中提到的“信息化领域热词分类”大作业启动数据采集的准备工作,初步计划用Python的requests和BeautifulSoup爬取技术博客的标签词。

posted @ 2026-08-20 19:58  hhxyb  阅读(2)  评论(0)    收藏  举报