8/21
我投入了大量精力在自动化部署和可视化呈现两个方向。使用Ambari的Blueprint功能,我编写了一份包含HDFS、YARN、Hive、Spark和ZooKeeper组件的集群蓝图配置文件,通过Ambari REST API一键触发了整个集群的安装和配置,整个过程虽然前期准备Blueprint的JSON结构花费了不少时间,但成功跑通后带来的效率提升令人振奋。Ambari自带的Grafana监控面板让我对集群的资源使用率、任务吞吐量和节点健康状态有了直观的掌控,我还配置了几条Alert规则,当DataNode磁盘使用率超过85%时自动发送告警邮件。项目作业方面,我对之前采集的2000多条热词数据进行了“领域归属-技术栈关联-热度指数”三维建模,使用Spark MLlib的KMeans算法尝试了无监督聚类,但由于标签数据多为短文本且语义稀疏,聚类效果并不理想,我随后转向基于TF-IDF的文本相似度计算方法,将词汇映射到向量空间后按余弦距离归类,准确率有明显提升。同时我用Python的wordcloud库生成了词云图,并整理了完整的Markdown格式分析报告。本周总学习时长约15小时,Ambari API调用和Python可视化代码占7小时,排障用了4小时,主要集中在Ambari注册Blueprint时组件版本号不匹配、PostgreSQL数据库编码未设为UTF-8导致元数据乱码等问题,通过重新初始化数据库指定编码后修复。词云图的中文显示也是个坑,默认字体不支持汉字,我指定了SimHei.ttf路径后才正常渲染。下周我计划学习BlueMap日志分析平台,接入HDFS的审计日志进行用户行为可视化,同时收尾大作业的技术文档和架构图。

浙公网安备 33010602011771号