爬虫复习

HTML和XML区别

XML标签自定义,HTML 标签内置的

正则复习

python 栈使用list实现

append pop  后进先出

队列 collections.deque

append()  popleft()

原子组成正则表达式的最小单位,任何字符都可以

 

 

 

 

 

 爬虫

用途,数据分析,人工智能数据集,作为社交软件冷启动,舆情监控,竞争对手监控

 

数据抓取(requests /urllib / pycurl / 工具 ----------->  cul / wget/ httpie ),数据解析,数据存储

 301永久重定向,302暂时重定向   https://blog.csdn.net/ai2000ai/article/details/80242193

请求头 :  Accept cookie User-Agent

Referer  来源网址

curl -A "Chrome"  http://www.baidu.com

httpbin.org  

curl -X POST http://httpbin.org/post

head 方法  

curl -I http://httpbin.org   返回响应报文的相应行和响应头

 

posted @ 2020-06-06 23:08  扣剑书生  阅读(145)  评论(0)    收藏  举报