王纯纯——第一次个人编程作业
| 课程| https://edu.cnblogs.com/campus/fzzcxy/2018CS/ |
| ---- | ---- | ---- |
| 具体要求 | https://edu.cnblogs.com/campus/fzzcxy/2018CS/homework/11732 |
| 实现目标 | 1.采集腾讯视频里电视剧《在一起》的全部评论信息 2.进行数据处理3.数据分析展示,将采集到的评论信息做成词云图 |
| 作业源代码 | https://github.com/chunzai666/first-personal-work |
| 学号 | 211806236 |
时间分布
| 爬取评论信息| 3h |
| ---- | ---- | ---- |
| 数据处理 | 1h |
| 数据展示 | 2h |
| 源代码上传github| 1.5h |
第一步:爬取评论信息************
利用python采集腾讯视频里电视剧《在一起》的全部评论信息是本次作业的重点,万事开头难。上学期的python爬虫掌握的不好,以至于开始做作业时一头雾水,不知道从何下手。然后我就去翻阅上学期的爬虫课件和练习作业,在网上找资料。由于自己代码能力薄弱,找到评论页面的源代码后却不知道要爬取什么,分辨不出有用的信息,经过一番查找和阅读同学们的方法才找到规律,自己总结一下写出爬虫的代码。过程如下:
1.首先在谷歌浏览器找到影评页面

2.利用开发者工具获得源代码****

会发现url的规律,变化的只有尾部的数字和"cursor="后面的数字,然后进行爬取
代码如下:

第二步:数据处理
得到爬取评论的结果

用jieba、re、Counter、json库来筛选统计高频词汇,这些知识对于我来说基本上是全新的,但是我并不能放弃,经过百度,网上找教程等各种方法才对他们有所了解,但运用的时候还是会出现各种问题,出现各种状况,于是就向同学们请教,向大佬看齐。自己尝试着做,虽然比着大佬还差的很远,但我希望我能够一点一点的进步。
第三步:对结果进行分析统计生成词云图

在生成词云图时这块知识又是一个全新的模块,还是需要加紧学习,不过我觉得这个内容虽然新,但是十分有趣,我非常有信心能够把它学好。
第四步: 源代码上传github
1.创建第一次编程文件夹并连接至github,将github克隆到本地

2.创建分支


3.向各个分支添加文件



4.合并分支上传仓库


5.结果显示

个人感悟
通过这次作业,真的深刻地认识到自己知识的欠缺和不足,刚开始接触作业时没有一点思路,在不断的尝试和反复推敲中,收获了很多,也对这次的作业有了深刻的理解。人生长路漫漫,活到老学到老!
参考文献
https://github.com/fxsjy/jieba
https://book.douban.com/subject/27133267/
https://www.cnblogs.com/Qqun821460695/p/12067594.html
https://www.jianshu.com/p/790a785d93ab

浙公网安备 33010602011771号