暑假周总结6

本周继续开发“信息化领域热词分类分析及解释”项目,重点完成热词分类、热词中文解释以及相关新闻引用功能。经过这一周之后,项目已经从单纯的数据统计逐渐变成一个能够提供实际信息查询功能的网站。

首先完善了热词分类功能。上周只是设计了人工智能、大数据、云计算、网络安全、数据库、物联网等几个类别,本周进一步为每个类别整理关键词。例如人工智能类别包含 AI、机器学习、深度学习、神经网络、大模型等,大数据类别包含 Hadoop、Spark、Hive、数据仓库等,数据库类别包含 MySQL、Redis、MongoDB、Oracle 等。

对于一篇文章,我分别统计标题和正文中的关键词出现次数,其中标题中的关键词赋予更高权重,因为标题通常更能代表文章主题。最终计算每个分类的总分,并选择得分最高的类别作为文章分类。如果所有类别得分都低于阈值,则暂时划分到“其他”。这种方法虽然属于规则分类,但符合课程中介绍的自动分类思路,而且运行效率比较高。

热词解释也是本周的重要功能。设计思路是首先在数据库中检查该热词是否已经存在解释,如果不存在,再通过网络数据源查找相关介绍,提取一个简短中文解释并保存到数据库中。这样同一个词以后再次出现时,不需要重复获取。

在实际处理时发现,有些热词存在歧义。例如“Spark”既可能表示 Apache Spark,也有普通英文单词含义;“Java”既可能指 Java 编程语言,也可能指爪哇岛。因此不能只根据热词名称直接保存解释,还需要结合当前分类和信息技术领域背景进行判断。我目前的方法是在查询时增加“编程”“数据库”“人工智能”等领域关键词,从而尽量获取正确解释。

新闻引用功能目前也基本实现。数据库中保存文章标题、来源、发布时间和 URL,并建立热词与文章之间的关联。用户打开某个热词详情页面时,可以看到近期包含该热词的相关新闻列表,点击标题可以跳转到原始网站。

这一功能写起来看似简单,但数据关联过程中遇到了不少问题。最开始直接为每个热词重复保存文章信息,导致数据库中产生大量重复记录。后来重新设计数据库,增加热词表、文章表以及热词文章关系表,通过多对多关系进行管理,数据库结构明显更加合理。

本周总学习时间大约为 26 小时,其中项目编码约 13 小时,中文分词和分类算法学习约 4 小时,数据库设计约 3 小时,Redis 和后端知识约 3 小时,排查程序问题约 3 小时。

Redis 方面学习了缓存一致性问题。了解到实际后端开发中不能只是简单地“查不到就放缓存”,还需要考虑数据库数据修改之后缓存如何更新。本周重点理解 Cache Aside Pattern,也就是先更新数据库再删除缓存等基本方案。

后端就业路线方面开始复习计算机网络,主要学习 HTTP 请求流程、GET 和 POST 区别、常见状态码、Cookie、Session 和 Token。因为项目本身就存在前后端 HTTP 请求,所以结合实际接口学习会更加容易理解。

下周准备重点完成热词词云和热词关系图。关系图是目前感觉难度最大的功能,需要设计两个热词之间“紧密程度”的计算方式。我计划尝试使用两个热词共同出现在同一篇文章中的次数作为基础指标,然后使用 ECharts Graph 进行展示。

posted @ 2026-08-28 16:12  时酒  阅读(4)  评论(0)    收藏  举报