暑假周总结1

本周是暑假学习计划正式开始的第一周,我主要完成了大型数据库技术大作业的需求分析,同时复习和学习 Hadoop 相关基础知识,并开始了解 Redis 和 Java 后端开发的整体就业路线。由于大作业涉及数据采集、MapReduce、Hive、Sqoop、MySQL、JavaWeb 和 ECharts 等多个技术,因此这一周没有急着开始写完整项目,而是先对整个项目进行了拆分,希望后面的开发能够按照比较清晰的步骤推进。

首先,我认真阅读了大型数据库技术大作业的要求。第一个实战案例是北京市政百姓信件分析,要求完成数据采集、MapReduce 数据清洗、HiveSQL 离线分析、Sqoop 数据导出以及 JavaWeb+ECharts 可视化。第二部分则需要自己完成“信息化领域热词分类分析及解释”项目。相比第一个案例,第二个项目增加了网络爬虫、热词自动分类、词语解释、新闻引用、词云、热词关系图以及 Word 报告导出等功能。因此我把整个项目暂时分成“数据采集层、数据处理层、数据存储层、后端服务层和前端展示层”几个部分。

技术学习方面,本周重新学习了 Hadoop 的基本组成,包括 HDFS、MapReduce 和 YARN。以前学习这些内容时更多是在记概念,这次结合项目后,我开始理解为什么需要 HDFS。网络爬取的数据量如果不断增加,就不适合只保存在普通文本文件中,而可以上传到 HDFS,再通过 MapReduce 和 Hive 进行后续处理。我还复习了 NameNode、DataNode、Block、Mapper 和 Reducer 等基本概念,并尝试在虚拟机环境中执行 hdfs dfs -ls /、创建目录、上传文件等操作。

本周总学习时间大约为 18 小时,其中理论学习约 10 小时,环境配置和代码实践约 6 小时,解决各种配置问题大约用了 2 小时。代码量目前不多,主要是 Hadoop 基础命令和一些简单 Java 测试代码。

本周遇到时间最长的问题是 Hadoop 环境配置。开始时 Java 环境变量、Hadoop 配置文件以及 SSH 免密登录之间有一些问题,导致启动 Hadoop 后部分进程没有正常出现。我通过查看 jps 输出、检查 core-site.xml、hdfs-site.xml 等配置文件逐步排查,最终能够正常启动基本服务。这个过程虽然比较耗时间,但是也让我意识到做大数据项目时,环境搭建本身就是很重要的一部分。

除此之外,我还抽出大约 3 小时了解 Redis。主要学习 Redis 是什么、为什么它的读写速度比较快,以及 String、Hash、List、Set、ZSet 五种常见数据类型。目前只是入门阶段,还没有和项目结合。

下周准备正式开始北京市政百姓信件案例的数据部分,重点学习网络数据采集方法,并尝试获取可以用于实验的数据。同时继续学习 MapReduce 编程模型,争取写出第一个完整的数据清洗程序。另外每天安排一定时间继续学习 Java 后端就业路线,为之后的 Spring Boot 和项目开发打基础。

posted @ 2026-08-28 16:11  时酒  阅读(5)  评论(0)    收藏  举报