随笔分类 -  Python

摘要:项目源码可以参考我的github:https://github.com/corolcorona/StacksSpider 1.明确需要获取的内容(标题,链接),然后把需要获取的内容写到items.py中,通过检查获取内容的html,可以看出我们要获取的内容标签 2.根据页面的html获取到我们需要的 阅读全文
posted @ 2017-05-03 16:24 corolcorona 阅读(244) 评论(0) 推荐(0)
摘要:本项目实现了获取stack overflow问题,使用python语言,scrapy框架,选取mongoDB作为持久化数据库,redis做为数据缓存 项目源码可以参考我的github:https://github.com/corolcorona/StacksSpider 1.创建一个scrapy项目 阅读全文
posted @ 2017-05-03 15:12 corolcorona 阅读(593) 评论(0) 推荐(0)
摘要:1.使用mongoDB必须已经安装mongoDB和pymongo 可以通过命令sudo pip install pymongo安装pymongo 2.settings.py 需要配置MongoDB的IP地址、端口号、数据记录名称,可以实现方便的更换MongoDB的数据库信息。引用pipelines. 阅读全文
posted @ 2017-05-03 12:35 corolcorona 阅读(276) 评论(0) 推荐(0)
摘要:项目源码可以参考我的github:https://github.com/corolcorona/spider_scrapy 1.执行以下命令安装redis模块 2.settings.py (报错exceptions.ValueError: ("Failed to instantiate dupefi 阅读全文
posted @ 2017-05-03 12:35 corolcorona 阅读(1170) 评论(1) 推荐(0)
摘要:用Python写了一个简单的爬虫,实现抓取图片素材,源代码可以查看我的GitHub:https://github.com/corolcorona/spider_demo 1.抓取图片链接:http://sc.chinaz.com/tupian/fengyetupian.html 选择查看源代码,需要 阅读全文
posted @ 2017-04-18 12:22 corolcorona 阅读(1289) 评论(0) 推荐(0)
摘要:OS模块是Python标准库中的一个操作模块,主要用于处理Linux操作系统中的文件和目录 1.要使用OS必须先导入OS 2.目录操作 os.getcwd()获取当前路径。 os.listdir()返回指定目录下的所有文件和目录名 os.mkdir()——创建目录(递归建立用:os.makedirs 阅读全文
posted @ 2017-04-17 13:43 corolcorona 阅读(252) 评论(0) 推荐(0)
摘要:BeautifulSoup是Python的一个库,可解析用urllib2抓取下来的HTML 1.Beautiful Soup 安装 可以利用 pip 来安装,在Python程序中导入 2.在Python中导入 3.创建 beautifulsoup 对象 4.beautifulsoup 的使用方法 拿 阅读全文
posted @ 2017-04-05 15:45 corolcorona 阅读(228) 评论(0) 推荐(0)
摘要:urllib2是Python的一个库(不用下载,安装,只需要使用时导入import urllib2)它提供了一系列用于操作URL的功能。 urlopen urllib2.urlopen可以接受Request对象,urllib不能,本文采用urllib2 urllib2.urlopen(url, *d 阅读全文
posted @ 2017-04-05 14:29 corolcorona 阅读(295) 评论(0) 推荐(0)