08 2022 档案

摘要:进程:是计算机资源分配的最小单元(进程为线程提供资源) 进程:是计算机中可以被cpu调度的最小单元(真正工作的最小单元) 注意:Linux系统使用底层fork;win:spawn; mac支持:fork 和 spawn (python3.8默认设置spawn) 因此在win下面必须要将程序放在 __ 阅读全文
posted @ 2022-08-31 09:04 机械猿 阅读(46) 评论(0) 推荐(0)
摘要:解决阻塞问题: import asyncio async def request(url): print("正在请求的url",url) print('请求成功') return url #async修饰的函数,调用之后返回一个协程对象 c = request("www.baidu.com") # 阅读全文
posted @ 2022-08-14 11:42 机械猿 阅读(64) 评论(0) 推荐(0)
摘要:import asyncio #协程模块引入 import time import aiohttp #实现异步操作的模块用于替代request模块(同步模块) start = time.time() urls =['http://XXX','http://xxx1']#异步请求列表 async de 阅读全文
posted @ 2022-08-14 11:05 机械猿 阅读(135) 评论(0) 推荐(0)
摘要:1.验证码是门户网站的反爬机制 (1)反爬机制:验证码:识别验证码图片中的数据,用于模拟登陆。 (2)识别验证码的操作: -人工肉眼识别(肉眼识别) - 第三方自动识别(推荐方式) 阅读全文
posted @ 2022-08-14 10:17 机械猿 阅读(104) 评论(0) 推荐(0)
摘要:1.环境安装: -pip install lxml 2.如何实例化一个etree对象: from lxml import etree(1)将本地的html文档中的源码数据加载到etree对象中: etree.parse(filePath) (2)可以将从互联网上获取的源码数据加载到etree对象中: 阅读全文
posted @ 2022-08-14 10:16 机械猿 阅读(74) 评论(0) 推荐(0)
摘要:1.requests模块介绍: python中原生的一款基于网络请求的模块,功能非常强大,简单便捷,效率极高; 作用:模拟浏览器发送请求 如何使用:(requests模块的编码流程) - 指定url - 发起请求(get,post) -获取相应数据 - 持久化存储(获取的是一个页面) 阅读全文
posted @ 2022-08-07 21:34 机械猿 阅读(68) 评论(0) 推荐(0)