每周总结08

学习2小时 代码8小时
本周完成的工作
本周在课程学习方面完成了Hive第五章的收尾内容,包括一个完整的实战案例。该案例从需求分析和数据加载开始,经历了ETL数据清洗转换、指标统计、BI工具安装到最终的可视化展现,形成了一个从原始数据到分析报表的完整闭环。通过这个案例,我实际体会了Hive在离线数仓场景中的完整应用流程,也对之前学习的建表、查询、函数等知识进行了综合运用。同时完成了相关实战案例的练习,巩固了操作熟练度。

数据结构方面,本周开始并完成了小学期数据结构课程的练习内容,对基础数据结构和算法有了进一步的理解和训练。

系统开发方面,本周主要对热词分析项目进行了优化。回顾上周的进度,热词项目已经具备了多来源采集、MapReduce清洗、二次热词过滤、历史快照恢复和Word报告导出等功能,但在实际使用中仍有一些体验和稳定性方面的问题需要打磨。本周的优化重点放在三个方面。第一是清洗效果的持续改进,针对部分网页结构差异较大导致正文提取不完整的情况,调整了Mapper中正文容器的识别策略,增加了对常见内容标签的兼容处理,使有效输出比例有所提升。第二是热词筛选逻辑的进一步细化,在原有的二次清洗基础上,对新闻模板词的过滤规则做了补充,减少了残留的泛化词汇对热词排序的干扰。第三是历史快照功能的稳定性增强,修复了在恢复旧记录后部分图表组件未能正确刷新数据的问题,确保恢复出来的热词图、关系图和引用文章与当时的数据一致。

此外,还对网页工作台的操作流程做了小幅调整,将数据清洗与导入步骤面板中的命令生成逻辑改为根据用户填写的实际路径动态拼接,避免因固定路径导致复制出来的命令无法直接使用。网页服务在修改后进行了本地验证,确认核心功能正常后停止了服务,端口已释放。

遇到的问题及解决

本周遇到的主要问题是部分网页正文提取不完整。排查后发现不同来源网页的正文容器标签差异较大,之前的识别规则过于依赖特定标签,遇到其他结构时就会漏提取。解决方式是增加多种常见正文容器的兼容匹配,并加入兜底逻辑,在没有匹配到明确容器时退回到正文密度判断。这样处理后,有效输出比例有所改善。

热词筛选方面,虽然已经做了二次清洗,但仍有少量模板化表达残留在候选词中。通过分析残留词汇的来源,补充了针对性的过滤规则,让最终呈现的热词更加聚焦在真正有信息量的关键词上。

历史快照恢复时图表刷新异常的问题,定位到是恢复数据后部分图表组件没有重新绑定数据源。修复后,每次恢复记录都会强制触发图表重新渲染,确保展示内容与所选批次一致。

下周计划

下周计划继续推进热词项目的完善,重点是以MySQL模式运行一次完整流程,验证批次标识字段的实际效果,确认多批次数据能够正确区分和展示。同时准备对北京信件项目进行回顾,检查是否有可以复用到热词项目中的功能设计或代码模块。课程学习方面,准备开始Hive后续的进阶内容或转向其他大数据组件的学习,继续巩固大数据技术栈的整体认知。数据结构练习也将继续按小学期要求推进。

posted @ 2026-08-29 21:04  赵朝印  阅读(8)  评论(0)    收藏  举报