第3次作业-MOOC学习笔记:Python网络爬虫与信息提取

1.注册中国大学MOOC

 

 

2.选择北京理工大学嵩天老师的《Python网络爬虫与信息提取》MOOC课程

 

 

3.学习完成第0周至第4周的课程内容,并完成各周作业

 

4.提供图片或网站显示的学习进度,证明学习的过程。

 

 

 

 

 

 

5.写一篇不少于1000字的学习笔记,谈一下学习的体会和收获。

通过学习嵩天老师的《Python网络爬虫与信息提取》,对爬虫知识有了部分了解。网络爬虫又被称为网页蜘蛛,是一种按照一定的规则,自动的抓取信息的程序或者脚本。爬虫技术是通过链接地址来寻找网页。通过这几天的学习,也体会到爬虫技术的有趣之处,但是要掌握这门技术,还是需要花很多心思去学习。在平台学习的过程中,也发现资源的广泛性,只要想学习,就可以从平台上寻找到各种有用的课程,通过学习课程,掌握知识。要学会好好利用这些宝贵的资源。这门课主要介绍Python计算生态中最优秀的网络数据爬取和解析技术,具体讲授了构建网络爬虫功能的两条重要技术路线:requests-bs4-re和Scrapy。

第一周中,我就学习到了requests库的主要方法:requests . request()==>构造一个请求,支撑以下各方法的基础方法;requests.get()==>获取HTML网页的主要方法,对应于HTTP的GET;requests.head()==>获取HTML网页头信息的方法,对应于HTTP的HEAD;requests.post()==>向HTML网页提交P0ST请求的方法,对应于HTTP的POST;requests. put()==>向HTML网页提交PUT请求的方法,对应于HTTP的PUT;requests . patch==>向HTML网页提交局部修改请求,对应于HTTP的PATCH;requests.delete()==>向HTML网页提交刪除请求,对应于HTTP的DELETE        重点是这些requests库内部的类和方法。第二周让我明白了requests是爬虫库,只用于获取页面,不对页面信息进行提取,也认识了BeautifulSoup4库,也知道了:Beautiful Soup库是解析、遍历、维护“标签树”的功能库,它还有Tag:标签;Name:标签的名字;Attributes:标签的属性;NavigableString: 标签内非属性字符串;Comment: 标签内字符串的注释部分五种基本元素,第三周的课程中学习了re库,这是个正则表达式库,不管是在python,java中都能用得上,可以用在数据校验中和数据提取等关于字符串的匹配上面,学习起来并不困难,但由于字符匹配的需要严谨,所以在匹配的严谨程度上来说是最困难的。将来我们可能会更多地接触到它。第四周,学习了Scrapy爬虫框架,Scrapy网络爬虫是基于Python语言开发的开源爬虫软件、提取结构性数据而编写的应用框架,用途非常广泛。其中Scrapy框架有五个模块,分别是Engine、Spiders、Scheduler、Downloader和Item Pipelines;

我深刻的认识到Python对于我们学习和工作都起到了很重要的作用,大大的降低了我们的时间,更快更好的对信息进行提取。接下来我会继续对Python网络爬虫与信息提取这门课程的学习,跟随老师的步伐,加深对知识点的学习与巩固,相信未来的某一天会对我们产生很大的帮助。

posted on 2019-10-30 22:39  牛牛k  阅读(212)  评论(0)    收藏  举报

导航