摘要: Mac OS 终端利器 iTerm2 转自:https://www.cnblogs.com/xishuai/p/mac-iterm2.html 之前一直使用 Mac OS 自带的终端,用起来虽然有些不太方便,但总体来说还是可以接受的,是有想换个终端的想法,然后今天偶然看到一个终端利器 iTerm2, 阅读全文
posted @ 2018-12-19 10:43 gaknl 阅读(696) 评论(0) 推荐(0)
摘要: 1、Python是如何进行内存管理的? 2、什么是lambda函数?它有什么好处? 3、解释一下python的and-or 语法? 4、Python是如何进行类型转换的? 5、Python里面如何拷贝一个对象? 6、Python中pass语句的作用是什么? 7、如何知道一个python对象的类型? 阅读全文
posted @ 2018-11-05 17:06 gaknl 阅读(291) 评论(0) 推荐(0)
摘要: 写一个flask项目: 1. JavaScript和Ajax编写单页程序 阅读全文
posted @ 2018-10-25 11:51 gaknl 阅读(253) 评论(0) 推荐(0)
摘要: 1 import urllib.request 2 import json 3 4 #定义要爬取的微博大V的微博ID 5 id='3995218983' 6 7 #设置代理IP 8 proxy_addr="122.241.72.191:808" 9 10 #定义页面打开函数 11 def use_proxy(url,proxy_addr): 12 req=urll... 阅读全文
posted @ 2018-10-19 10:42 gaknl 阅读(1275) 评论(0) 推荐(0)
摘要: 1 本节目标 本次爬取的日标是新浪微博用户的公开基本信息,如用户昵称、头像、用户的关注、粉丝列表以 及发布的微博等,这些信息抓取之后保存至 MongoDB。 2.如何实现: 以微博的几个大 V为起始点,爬取 他们各内的粉丝和关注列表,然后获取粉丝和关注列表的粉丝和关注列表,以 此类推,这样下去就可 阅读全文
posted @ 2018-10-19 10:26 gaknl 阅读(1286) 评论(0) 推荐(0)
摘要: 1. 架构 引擎(Scrapy):用来处理整个系统的数据流处理, 触发事务(框架核心) 调度器(Scheduler):用来接受引擎发过来的请求, 压入队列中, 并在引擎再次请求的时候返回. 可以想像成一个URL(抓取网页的网址或者说是链接)的优先队列, 由它来决定下一个要抓取的网址是什么, 同时去除 阅读全文
posted @ 2018-10-18 23:01 gaknl 阅读(3229) 评论(0) 推荐(0)
摘要: 1. 与scrapy的比较: pyspider提供 了 WebUI,爬虫的编写、调试都是在 WebUI 中进行的 。 而 Scrapy原生是不具备这个功能的,它采用的是代码和命令行操作,但可以通过对接 Portia实现可视化配置。 pyspider调试非常方便 , WebUI操作便捷直观。 Scra 阅读全文
posted @ 2018-10-18 00:02 gaknl 阅读(4865) 评论(0) 推荐(0)
摘要: 1。 Charles 阅读全文
posted @ 2018-10-17 21:43 gaknl 阅读(312) 评论(0) 推荐(0)
摘要: 1.cookies池的搭建 Cookies池需要有自动生成 Cookies、定时检测 Cookies、提供随机 Cookies等几大核心功能。 Cookies 池架构的基本模块分为 4 块:存储模块 、 生成模块、检测模块和接口模块 。 每个模块的 功能如下 。 存储模块负责存储每个账号的用户名密码 阅读全文
posted @ 2018-10-17 21:42 gaknl 阅读(433) 评论(0) 推荐(0)
摘要: g 阅读全文
posted @ 2018-10-17 11:01 gaknl 阅读(220) 评论(0) 推荐(0)