随笔分类 - Python
摘要:一.判断异步加载方式(常用的JS库) 1. jQuery(70%) 搜索 jquery 茅塞顿开 2.Google Analytics(50%) 搜索 Google Analytics <! Google Analytics
阅读全文
摘要:获得HTML html = urlopen('http://example.com') 获得 BeautifulSoup对象 (完整的DOM Tree) bsObj = BeautifulSoup(html.read) 过时 bsObj = BeautifulSoup(html,'html.pars
阅读全文
摘要:"Python 解析XML" URL_to_start http://baike.baidu.com/item/python <! 总爬取数量 默认: 1 无限制 count 10 <! 总爬取时间(分钟) 默认: 1 无限制 run_time 1 <! 线程数 默认:1 Thread_count
阅读全文
摘要:连接方法 使用 Python DB API(整合了绝大部分的数据库) 使用 pymysql 包 整体思想 数据库连接对象 connection 数据库游标对象 cursor 程序Demo import pymysql.cursors class MySQLUtils(): def executeSQ
阅读全文
摘要:整体架构 "主函数" 一、 URL管理器 管理即将爬取的URL和已经爬取的URL "URL管理器" 二、 网页下载器 用于下载网页 "三种urllib实现网页下载,含cookie模拟登陆" 三、 网页解析器 用于解析网页,获得有价值数据或者新的待爬取URL填充URL管理器 "使用bs4的网页解析器"
阅读全文
摘要:coding=UTF 8 HTML输出器 import sys class htmlOutputer(): def __init__(self): self.data = [] def collect_data(self, data): if data is None: return self.da
阅读全文
摘要:coding=UTF 8 HTML解释器 import re from bs4 import BeautifulSoup class htmlParser(): def parse(self, url, html_cont): if url is None or html_cont is None:
阅读全文
摘要:coding=UTF 8 import re import urllib.request, http.cookiejar, urllib.parse print(' 第一种方法 ') URL = 'https://baike.baidu.com/item/%E5%B7%B4%E6%B2%99%E5%
阅读全文
摘要:coding=UTF 8 url管理器 class urlManeger: def __init__(self): self.new_urls = set() self.old_urls = set() def add_new_url(self, url): if url is None: retu
阅读全文
摘要:coding=UTF 8 import html_download import html_outputer import html_parser import url_maneger class SpiderMain(object): 构造器 def __init__(self): 1:初始化组件
阅读全文
摘要:集合,无序,元素只出现一次, 自动去重,使用”set([])” 相当于只有 key 的字典 !无序 !自动去重 定义 使用已有的list创建set L = [1,2,3,4,6,7,8,9,0] s = set(L) s = set([1,2,4,5,6,7,8]) 对于有重复元素的list ,se
阅读全文
摘要:典,字典是一组键(key)和值(value)的组合,通过键(key)进行查找, 没有顺序 , 使用大括号”{}” !key不允许重复 !key不可变,list不能作为key 定义 d = {'key':'value','name':'czm','id':1} 获取值 键值索引 d['key'] 使用
阅读全文
摘要:元组,元组将多样的对象集合到一起,元素不能修改,通过索引进行查找, 使用括号”()” 允许重复 定义 空元组 t = () 单个元组,需要加逗号结尾,用于区别元组 t = (1,) t = ('你几号',) 多元组 t = (1,23,45,5,6) “可变”元组 其中的list内容依旧可变,因为元
阅读全文
摘要:链表,有序的项目, 通过索引进行查找,使用方括号”[]”,元素允许修改 定义 L = ['Adam', 'Lisa', 'Bart'] L = ['asdf',1,True] 索引 L[0] L[ 1] 尾部添加 L.append('asd') 任意位置插入 L.insert(0, 'Paul')
阅读全文
摘要:1.理清一些知识点: python默认的编码格式: ASCII(py2) unicode(py3) 查看默认编码:sys.defaultencoding 修改默认编码: coding = utf 8 unicode是一种编码标准 其实就是还没编码 具体的实现标准可能是utf 8,utf 16,gbk
阅读全文
摘要:简单的爬虫架构 调度器 URL管理器 管理待抓取的URL集合和已抓取的URL,防止重复抓取,防止死循环 功能列表 1:判断新添加URL是否在容器中 2:向管理器添加新URL 3:判断容器是否为空 4:将已爬取URL移动到已爬取集合 5:获取待爬取URL 实现方式 1:使用set(自动去除重复项目)
阅读全文
摘要:网络编程 requests模块是rullib3的拓展模块 抓取网络示例 import requests czm = requests.get('http://cenzhongman.cn') file = open('html.html','w') file.write(czm.content) f
阅读全文
摘要:定义一个类 class people(): '我是一个人类' str = '我是公有属性' __str2 = '我是私有属性' def __init__(self,name,age): super(people, self).__init__() 调用父类构造函数,非必须 self.name = n
阅读全文

浙公网安备 33010602011771号