爬取西刺网的免费IP

在写爬虫时，经常需要切换IP，所以很有必要自已在数据维护库中维护一个IP池，这样，就可以在需用的时候随机切换IP，我的方法是爬取西刺网的免费IP，存入数据库中，然后在scrapy 工程中加入tools这个目录，里面存放一些常用的目录，包括这个免费IP池，具体目录如下：

crawl_ip_from_xichi.py 代码如下：

import requests

from fake_useragent import UserAgent

from scrapy.selector import Selector

import time

import pymysql

class GetIPFromXichi(object):

    """通过西刺得到可用的IP，存入数据库"""

    def crawl_ip(self):

        """爬取西刺的免费IP"""

        ip_list = []

        for i in range(1, 20):

            headers = UserAgent()

            ua = getattr(headers, "random")

            ua = {"User-Agent": ua}

            url = "http://www.xicidaili.com/nn/" + str(i)

            response = requests.get("http://www.xicidaili.com/nn/", headers=ua)

            time.sleep(3)

            selector = Selector(text=response.text)

            alltr = selector.css("#ip_list tr")

            for tr in alltr[1:]:

                speed_str = tr.css(".bar::attr(title)").extract_first()

                if speed_str:

                    speed = float(speed_str.split("秒")[0])

                else:

                    speed = 0

                all_text = tr.css("td ::text").extract()

                ip = all_text[0]

                port = all_text[1]

                type = all_text[6]

                if not 'HTTP' in type.upper():

                    type = "HTTP"

                ip_list.append((ip, port, type, speed))

        conn = pymysql.connect(host="127.0.0.1", user="root", password="root", db="outback")

        cursor = conn.cursor()

        insert_sql = """insert into ip_proxy(ip,port,type,speed) VALUES (%s,%s,%s,%s) """

        for i in ip_list:

            try:

                cursor.execute(insert_sql, (i[0], i[1], i[2], i[3]))

                conn.commit()

            except Exception as e:

                print(e)

                conn.rollback()

        cursor.close()

        conn.close()

if __name__ == "__main__":

    crawl_ip_from_xichi=GetIPFromXichi()

    crawl_ip_from_xichi.crawl_ip()

这里有几个容易出错的地方，

一，把函数放在main线程中去执行，这样在以后导入这个类时就不会执行一次，

二，数据连接一定是在整个循环执行完之后才关闭。

三，为了使这个爬虫更加友好，每爬取一页面 sleep 3秒，

github https://github.com/573320328/tools

爬取西刺网的免费IP的更多相关文章

爬取西刺网代理ip，并把其存放mysql数据库
需求: 获取西刺网代理ip信息,包括ip地址.端口号.ip类型西刺网:http://www.xicidaili.com/nn/ 那,如何解决这个问题? 分析页面结构和url设计得知: 数据都在本页面 ...
爬取西刺ip代理池
好久没更新博客啦~,今天来更新一篇利用爬虫爬取西刺的代理池的小代码先说下需求,我们都是用python写一段小代码去爬取自己所需要的信息,这是可取的,但是,有一些网站呢,对我们的网络爬虫做了一些限制, ...
scrapy爬取西刺网站ip
# scrapy爬取西刺网站ip # -*- coding: utf-8 -*- import scrapy from xici.items import XiciItem class Xicispi ...
Python四线程爬取西刺代理
import requests from bs4 import BeautifulSoup import lxml import telnetlib #验证代理的可用性 import pymysql. ...
使用XPath爬取西刺代理
因为在Scrapy的使用过程中,提取页面信息使用XPath比较方便,遂成此文. 在b站上看了介绍XPath的:https://www.bilibili.com/video/av30320885?fro ...
手把手教你使用Python爬取西刺代理数据（下篇）
/1 前言/ 前几天小编发布了手把手教你使用Python爬取西次代理数据(上篇),木有赶上车的小伙伴,可以戳进去看看.今天小编带大家进行网页结构的分析以及网页数据的提取,具体步骤如下. /2 首页分析 ...
python scrapy 爬取西刺代理ip(一基础篇)（ubuntu环境下） -赖大大
第一步:环境搭建 1.python2 或 python3 2.用pip安装下载scrapy框架具体就自行百度了,主要内容不是在这. 第二步:创建scrapy(简单介绍) 1.Creating a p ...
python+scrapy 爬取西刺代理ip(一)
转自:https://www.cnblogs.com/lyc642983907/p/10739577.html 第一步:环境搭建 1.python2 或 python3 2.用pip安装下载scrap ...
Scrapy爬取西刺代理ip流程
西刺代理爬虫 1. 新建项目和爬虫 scrapy startproject daili_ips ...... cd daili_ips/ #爬虫名称和domains scrapy genspider ...

随机推荐

CSS3让长单词与URL地址自动换行——word-wrap属性
div{ word-wrap:break-word; } word-wrap属性可以使用的属性值为normal与break-word两个.使用normal属性值时浏览器默认处理,只在半角空格或者连字符 ...
【Java学习笔记之二十三】instanceof运算符的用法小结
instanceof运算符用法运算符是双目运算符,左面的操作元是一个对象,右面是一个类.当左面的对象是右面的类创建的对象时,该运算符运算的结果是true,否则是false 说明: (1)一个类的实例 ...
bzoj:2331: [SCOI2011]地板
Description lxhgww的小名叫“小L”,这是因为他总是很喜欢L型的东西.小L家的客厅是一个的矩形,现在他想用L型的地板来铺满整个客厅,客厅里有些位置有柱子,不能铺地板.现在小L想知道,用 ...
http://acm.hdu.edu.cn/showproblem.php?pid=1039(水~)
判读条件 1:有元音字母 2:不能三个连续元音或辅音 3.不能连续两个相同的字母,除非ee或oo #include<cstdio> #include<cstring> #inc ...
vue -- v-cloak解决刷新或者加载出现闪烁（显示变量）
在使用vue绑定数据的时候,渲染页面时会出现变量闪烁,例如 <div class="#app"> <p>{{value.name}}</p> & ...
[国嵌笔记][031][Bootloader架构设计]
thinkphp无法加载控制器:Admin
在使用thinkphp时,通过某入口文件访问其他非默认的模块(比如Admin模块),出现报错: 无法加载控制器:Admin 原因:入口文件(比如index.php)中定义了绑定某个具体的模块如:de ...
YourPHP笔记
http://blog.sina.com.cn/s/blog_7c54793101016qq1.htm 基础认识: Ø yourphp安装为子目录时不可以以"yourphp"为文 ...
基于Redis的分布式锁的简单实现
Redis官方给出两种思路第一种:SET key value [EX seconds] [PX milliseconds] NX 第二种:SETNX+GETSET 首先,分别看一下这几个命令 SET ...
ios开发－第二天
1.#import可保证无论头文件出现多少次,只包含一次,而#include相反. 2.如果用户不提供文件路径的话,那么argc的值为1,可以用来做是否错误的判断. 3.面向对象和面向过程的区别面向 ...

爬取西刺网的免费IP

爬取西刺网的免费IP的更多相关文章

随机推荐

热门专题