python爬西刺代理

爬IP代码

import requests

import re

import  dauk

from bs4 import BeautifulSoup

import time

def daili():

      print('[+]极速爬取代理IP，默认为99页')

      for b in range(1,99):

        url="http://www.xicidaili.com/nt/{}".format(b)

        header={'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:58.0) Gecko/20100101 Firefox/48.0'}

        r=requests.get(url,headers=header)

        gsx=BeautifulSoup(r.content,'html.parser')

        for line in gsx.find_all('td'):

            sf=line.get_text()

            dailix=re.findall('(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)',str(sf))

            for g in dailix:

                po=".".join(g)

                print(po)

                with open ('采集到的IP.txt','a') as l:

                    l.write(po+'\n')

daili()

def dailigaoni():

    print('[+]极速爬取代理IP，默认为99页')

    for i in range(1,99):

      url="http://www.xicidaili.com/nn/{}".format(i)

      header={'User-Agent':'Mozilla/5.0 (Windows NT 6.1 Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

      r=requests.get(url,headers=header)

      bks=r.content

      luk=re.findall('(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)',str(bks))

      for g in luk:

          vks=".".join(g)

          print(vks)

          with open('采集到的IP.txt','a') as b:

              b.write(vks+'\n')

dailigaoni()

def dailihtp():

    print('[+]极速爬取代理IP，默认为99页')

    for x in range(1,99):

        header="{'User-Agent':'Mozilla/5.0 (Windows NT 6.1 Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}"

        url="http://www.xicidaili.com/wn/{}".format(x)

        r=requests.get(url,headers=header)

        gs=r.content

        bs=re.findall('(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)',gs)

        for kl in bs:

            kgf=".".join(kl)

            print(kgf)

            with open ('采集到的IP.txt','a') as h:

                h.write(kgf)

dailihtp()

def dailihttps():

    print('[+]极速爬代理IP,默认为99页')

    for s in range(1,99):

        url="http://www.xicidaili.com/wt/{}".format(s)

        header={'User-Agent':'Mozilla/5.0 (Windows NT 6.1 Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

        r=requests.get(url,headers=header)

        kl=r.content

        lox=re.findall('(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)\.(25[0-5]|2[0-4]\d|[0-1]\d{2}|[1-9]?\d)',kl)

        for lk in lox:

            los=".".join(lk)

            print(los)

            with open('采集到的IP.txt','a') as lp:

                lp.write(los)

dailihttps()

　端口代码

import requests

import re

from bs4 import BeautifulSoup

def daili():

    print('[+]极速爬取代理IP端口，默认为99页')

    for b in range(1, 99):

        url = "http://www.xicidaili.com/nt/{}".format(b)

        header = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:58.0) Gecko/20100101 Firefox/48.0'}

        r = requests.get(url, headers=header)

        gsx = BeautifulSoup(r.content, 'html.parser')

        for line in gsx.find_all('td'):

            sf = line.get_text()

            dailix = re.findall(

                '<td>([0-9]|[1-9]\d{1,3}|[1-5]\d{4}|6[0-5]{2}[0-3][0-5])</td>',

                str(sf))

            for g in dailix:

                po = ".".join(g)

                print(po )

                with open('采集到的端口.txt.txt', 'a') as l:

                    l.write(po + '\n')

daili()

def dailigaoni():

    print('[+]极速爬取代理IP的端口，默认为99页')

    for i in range(1, 99):

        url = "http://www.xicidaili.com/nn/{}".format(i)

        header = {

            'User-Agent': 'Mozilla/5.0 (Windows NT 6.1 Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

        r = requests.get(url, headers=header)

        bks = r.content

        luk = re.findall(

            '<td>([0-9]|[1-9]\d{1,3}|[1-5]\d{4}|6[0-5]{2}[0-3][0-5])</td>',

            str(bks))

        for g in luk:

            vks = ".".join(g)

            print(vks)

            with open('采集到的端口.txt.txt', 'a') as b:

                b.write(vks + '\n')

dailigaoni()

def dailihtp():

    print('[+]极速爬取代理IP，默认为99页')

    for x in range(1, 99):

        header = "{'User-Agent':'Mozilla/5.0 (Windows NT 6.1 Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}"

        url = "http://www.xicidaili.com/wn/{}".format(x)

        r = requests.get(url, headers=header)

        gs = r.content

        bs = re.findall(

            '<td>([0-9]|[1-9]\d{1,3}|[1-5]\d{4}|6[0-5]{2}[0-3][0-5])</td>',

            gs)

        for kl in bs:

            kgf = ".".join(kl)

            print(kgf)

            with open('采集到的端口.txt.txt', 'a') as h:

                h.write(kgf)

dailihtp()

def dailihttps():

    print('[+]极速爬代理IP的端口,默认为99页')

    for s in range(1, 99):

        url = "http://www.xicidaili.com/wt/{}".format(s)

        header = {

            'User-Agent': 'Mozilla/5.0 (Windows NT 6.1 Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

        r = requests.get(url, headers=header)

        kl = r.content

        lox = re.findall(

            '<td>([0-9]|[1-9]\d{1,3}|[1-5]\d{4}|6[0-5]{2}[0-3][0-5])</td>',

            kl)

        for lk in lox:

            los = ".".join(lk)

            print(los)

            with open('采集到的端口.txt', 'a') as lp:

                lp.write(los)

dailihttps()

　　调用代码

print('''

                   _ooOoo_

                  o8888888o

                  88" . "88

                  (| -_- |)

                  O\  =  /O

               ____/`---'\____

             .'  \\|     |//  `.

            /  \\|||  :  |||//  \

           /  _||||| -:- |||||-  \

           |   | \\\  -  /// |   |

           | \_|  ''\---/''  |   |

           \  .-\__  `-`  ___/-. /

         ___`. .'  /--.--\  `. . __

      ."" '<  `.___\_<|>_/___.'  >'"".

     | | :  `- \`.;`\ _ /`;.`/ - ` : | |

     \  \ `-.   \_ __\ /__ _/   .-` /  /

======`-.____`-.___\_____/___.-`____.-'======

                   `=---='

^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

            佛祖保佑       永无BUG

            ''')

print('[!]爬虫速度过快，导致IP被封请更换IP')

print('[*]极速爬取代理IP')

print('1.普通代理IP')

print('2.高匿代理IP')

print('3.http代理IP')

print('4.https代理IP')

bk=input('请选择：')

def xs():

  import 代理.daili

  import 代理.dauk

  if bk=='1':

        代理.daili.daili.daili()

        代理.dauk.daili()

        exit()

  elif bk=='2':

      代理.daili.daili.dailigaoni()

      代理.dauk.dailigaoni()

      exit()

  elif bk=='3':

      代理.daili.daili.dailihtp()

      代理.dauk.dailihtp()

      exit()

  elif bk=='4':

      代理.daili .daili.dailihttps()

      代理.dauk.dailihttps()

      exit()

  elif bk=='q':

      exit()

  else:

      print('[-]没有找到你要的选项')

xs()

2018-02-17

python爬西刺代理的更多相关文章

代理IP爬取和验证（快代理&西刺代理）
前言仅仅伪装网页agent是不够的,你还需要一点新东西今天主要讲解两个比较知名的国内免费IP代理网站:西刺代理&快代理,我们主要的目标是爬取其免费的高匿代理,这些IP有两大特点:免费,不稳 ...
使用XPath爬取西刺代理
因为在Scrapy的使用过程中,提取页面信息使用XPath比较方便,遂成此文. 在b站上看了介绍XPath的:https://www.bilibili.com/video/av30320885?fro ...
Scrapy爬取西刺代理ip流程
西刺代理爬虫 1. 新建项目和爬虫 scrapy startproject daili_ips ...... cd daili_ips/ #爬虫名称和domains scrapy genspider ...
python scrapy 爬取西刺代理ip(一基础篇)（ubuntu环境下） -赖大大
第一步:环境搭建 1.python2 或 python3 2.用pip安装下载scrapy框架具体就自行百度了,主要内容不是在这. 第二步:创建scrapy(简单介绍) 1.Creating a p ...
Python四线程爬取西刺代理
import requests from bs4 import BeautifulSoup import lxml import telnetlib #验证代理的可用性 import pymysql. ...
python+scrapy 爬取西刺代理ip(一)
转自:https://www.cnblogs.com/lyc642983907/p/10739577.html 第一步:环境搭建 1.python2 或 python3 2.用pip安装下载scrap ...
手把手教你使用Python爬取西刺代理数据（下篇）
/1 前言/ 前几天小编发布了手把手教你使用Python爬取西次代理数据(上篇),木有赶上车的小伙伴,可以戳进去看看.今天小编带大家进行网页结构的分析以及网页数据的提取,具体步骤如下. /2 首页分析 ...
python3爬虫-通过requests爬取西刺代理
import requests from fake_useragent import UserAgent from lxml import etree from urllib.parse import ...
极简代理IP爬取代码——Python爬取免费代理IP
这两日又捡起了许久不碰的爬虫知识,原因是亲友在朋友圈拉人投票,点进去一看发现不用登陆或注册,觉得并不复杂,就一时技痒搞一搞,看看自己的知识都忘到啥样了. 分析一看,其实就是个post请求,需要的信息都 ...

随机推荐

二 web爬虫，scrapy模块以及相关依赖模块安装
当前环境python3.5 ,windows10系统 Linux系统安装在线安装,会自动安装scrapy模块以及相关依赖模块 pip install Scrapy 手动源码安装,比较麻烦要自己手动安 ...
Database项目中关于Procedure sp_refreshsqlmodule_internal的错误
最近项目中发现一怪问题,使用DB项目发布数据库时,总提示 “(110,1): SQL72014: .Net SqlClient Data Provider: Msg 1222, Level 16, S ...
springboot项目执行controller方法时进入慢的问题
今天在部署springboot项目到阿里云时,出现登录方法执行特别慢的问题.刚开始以为是卡死了,等了3,4分钟才进去,最后会出现如下信息: 2018-01-28 15:38:36.958 INFO 4 ...
【python】windows下安装xgboost的python库
傻瓜教程主要参考了https://www.hongweipeng.com/index.php/archives/826/ 和 https://github.com/dmlc/xgboost/iss ...
打印机无法使用且无法重新安装，提示spooler service is not running
使用场景:之前安装好的打印服务今天突然无法使用,列表里面找不到打印机,于是重新安装,得到以下错误: The local print spooler service is not running. Pl ...
ASP调用存储过程访问SQL Server
ASP调用存储过程访问SQL Server 2011-02-15 10:22:57 标签:asp 数据库 sQL 存储过程 Server ASP和存储过程(Stored Procedures)的文章 ...
Java 线程的中断机制
今天我们聊聊 Java 线程的中断机制. 线程中断机制提供了一种方法,用于将线程从阻塞等待中唤醒,并作出相应的“受控中断”处理. synchronized (lock) { try { while ( ...
你必须知道的495个C语言问题，学习体会一
C语言作为一门古老的语言,其灵活性和容易出错都让人又爱又恨,书籍<你必须知道的495个C语言问题>,使用问答的形式,告诉读者 C语言使用的各个方面的知识,包括一些冷知识等.以下,我要摘录 ...
volley源码解析-Throwable类源码解析
前提知识点: 1.Serializable接口作用:表示可序列化的语义.就是Java提供的通用数据保存和读取接口.任何类型实现了Serializeable接口,就可以被保存到文件中,或者作为数据流通 ...
排序算法总结(C#版）
算法质量的衡量标准: 1:时间复杂度:分析关键字比较次数和记录的移动次数: 2:空间复杂度:需要的辅助内存: 3:稳定性:相同的关键字计算后,次序是否不变. 简单排序方法 .直接插入排序直接插入排序 ...

python爬西刺代理

python爬西刺代理的更多相关文章

随机推荐

热门专题