随笔分类 -  python爬虫

python协程爬取某网站的老赖数据
摘要:import re import json import aiohttp import asyncio import time import pymysql from asyncio.locks import Semaphore from functools import partial heade 阅读全文

posted @ 2021-01-20 14:19 Tarantino 阅读(275) 评论(0) 推荐(1)

scrapy meta信息丢失
摘要:在做58同城爬二手房时,由于房产详情页内对价格进行了转码处理,所以只能从获取详情页url时同时获取该url对应房产的价格,并通过meta传递给下回调函数 现在问题是,在回调函数中找不到原函数meta信息: 我第一猜想是由于请求经过各种retry重试,和rediret到jump_url、firewal 阅读全文

posted @ 2019-04-22 14:59 Tarantino 阅读(582) 评论(0) 推荐(0)

针对特定网站scrapy爬虫的性能优化
摘要:在使用scrapy爬虫做性能优化时,一定要根据不同网站的特点来进行优化,不要使用一种固定的模式去爬取一个网站,这个是真理,以下是对58同城的爬取优化策略: 一、先来分析一下影响scrapy性能的settings设置(部分常用设置):1,DOWNLOAD_TIMEOUT,下载超时,默认180S,若超时 阅读全文

posted @ 2019-04-19 18:20 Tarantino 阅读(2500) 评论(0) 推荐(1)

scrapy爬取58同城二手房问题与对策
摘要:测试环境: win10,单机爬取,scrapy1.5.0,python3.6.4,mongodb,Robo 3T 其他准备: 代理池:测试环境就没有用搭建的flask抓代理,因为我找到的几个免费网站有效ip不够多,因此从xxx网站批量获取了800多个免费https代理,然后开线程池测试访问58同城网 阅读全文

posted @ 2019-04-17 19:29 Tarantino 阅读(1832) 评论(0) 推荐(0)

使用Pyquery+selenium抓取淘宝商品信息
摘要:配置文件,配置好数据库名称,表名称,要搜索的产品类目,要爬取的页数 主程序 阅读全文

posted @ 2018-06-15 21:02 Tarantino 阅读(239) 评论(0) 推荐(0)

python + Jquery,抓取西东网上的Java教程资源网址
摘要:#!/usr/bin/env python # -*- coding: utf-8 -*- # @Date : 2018-06-15 14:01:45 # @Author : Chenjun (320316430@qq.com;) # @Link : http://example.org # @Version : $Id$ from pyquery import PyQuery ... 阅读全文

posted @ 2018-06-15 19:17 Tarantino 阅读(205) 评论(0) 推荐(0)

导航