爬取代理IP，并判断是否可用。

 # -*- coding:utf-8 -*-

 from gevent import monkey

 monkey.patch_all()

 import urllib2

 from gevent.pool import Pool

 import requests

 import re

 class SpiderProxy:

     def __init__(self):

         self.headers = {

             "Host": "www.xicidaili.com",

             "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10.11; rv:47.0) Gecko/20100101 Firefox/47.0",

             "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",

             "Accept-Language": "en-US,en;q=0.5",

             "Accept-Encoding": "gzip, deflate",

             "Referer": "http://www.xicidaili.com/nn/",

             }

         self.url = 'http://www.xicidaili.com/nn/'

         self.proxy_list = []

         self.re_ip = re.compile(r'(?<![\.\d])(?:\d{1,3}\.){3}\d{1,3}(?![\.\d])')

         self.re_port = re.compile(r'<td>(\d+)</td>')

     def get_pagesource(self):

         ''' 取得所有1-n页上的代理IP'''

         try:

             num = int(raw_input('please input 1-'))

             for i in range(1, num + 1):

                 pageurl = self.url + str(i)

                 req = requests.session()

                 html = req.get(pageurl, headers=self.headers)

                 ip_list = self.re_ip.findall(html.text)

                 port_list = self.re_port.findall(html.text)

                 proxy_zip = zip(ip_list, port_list)

                 for i in proxy_zip:

                     self.proxy_list.append({'http':i[0] + ':' + i[1]})

         except ValueError:

             print 'please input a num!'

         return self.proxy_list

 class IsActiveProxyIP:

     def __init__(self):

         self.is_active_proxy_ip = []

     def probe_proxy_ip(self, proxy_ip):

         proxy = urllib2.ProxyHandler(proxy_ip)

         opener = urllib2.build_opener(proxy)

         urllib2.install_opener(opener)

         try:

             html = urllib2.urlopen('http://1212.ip138.com/ic.asp')

             if html:

                 self.is_active_proxy_ip.append(proxy_ip)

                 return True

             else:

                 return False

         except Exception as e:

             return False

 if __name__ == '__main__':

     Proxy = SpiderProxy()

     proxy_list = Proxy.get_pagesource()

     proxy_isactive = IsActiveProxyIP()

     pool = Pool(20)

     pool.map(proxy_isactive.probe_proxy_ip, proxy_list)

     with open(r'E:\python_demo\proxy_ip.txt', 'wb') as f:

         for ip in proxy_isactive.is_active_proxy_ip:

             ip = str(ip)

             f.write(ip[11:-2] + '\n')

     print 'file successed written'

爬取代理IP，并判断是否可用。的更多相关文章

python爬虫爬取代理IP
# #author:wuhao # #--*------------*-- #-****#爬取代理IP并保存到Excel----#爬取当日的代理IP并保存到Excel,目标网站xicidaili.co ...
使用Python爬取代理ip
本文主要代码用于有代理网站http://www.kuaidaili.com/free/intr中的代理ip爬取,爬虫使用过程中需要输入含有代理ip的网页链接. 测试ip是否可以用 import tel ...
自动爬取代理IP例子
import time import json import datetime import threading import requests from lxml import etree from ...
python代理池的构建3——爬取代理ip
上篇博客地址:python代理池的构建2--代理ip是否可用的处理和检查一.基础爬虫模块(Base_spider.py) #-*-coding:utf-8-*- ''' 目标: 实现可以指定不同UR ...
python 批量爬取代理ip
import urllib.request import re import time import random def getResponse(url): req = urllib.request ...
爬取代理IP
现在爬虫好难做啊,有些网站直接封IP,本人小白一个,还没钱,只能找免费的代理IP,于是去爬了西刺免费代理,结果技术值太低,程序还没调试好, IP又被封了... IP又被封了... IP又被封了... ...
爬虫爬取代理IP池及代理IP的验证
最近项目内容需要引入代理IP去爬取内容. 为了项目持续运行,需要不断构造.维护.验证代理IP. 为了绕过服务端对IP 和频率的限制,为了阻止服务端获取真正的主机IP. 一.服务器如何获取客户端IP ...
原创:Python爬虫实战之爬取代理ip
编程的快乐只有在运行成功的那一刻才知道QAQ 目标网站:https://www.kuaidaili.com/free/inha/ #若有侵权请联系我因为上面的代理都是http的所以没写这个判断代 ...
Python爬取代理ip
# -*- coding:utf-8 -*- #author : willowj import urllib import urllib2 from bs4 import BeautifulSoup ...

随机推荐

JS——定时器
定时器在JS中的作用: 1)制作动画.时钟.倒计时 2)异步操作 3)函数缓冲与节流定时器类型: 1)setTimeout 只执行一次的定时器 2)clearTimeout 关闭只执行一次的定时器 ...
grep 显示匹配行的上下n行
grep -C 5 foo file 显示file文件中匹配foo字串那行以及上下5行grep -B 5 foo file 显示foo及前5行grep -A 5 foo file 显示foo及后5行
记录一个调试REST风格的web服务的client
coogle浏览器的advanced rest client很好用,记录一下,脑子不好,容易忘,,可以在chrome 的网上应用店添加 Rest client是用来调试REST风格的Web服务,接收P ...
Repair 暴力
Description standard input/outputStatements Alex is repairing his country house. He has a rectangula ...
Linux Shell简单命令
sudo uname --m 查看操作系统位数sudo uname --s 显示内核名字ssudo uname --r 显示内核版本sudo uname --n 显示网络主机名sudo uname - ...
Aspose.cell生成表格
public void ExportQueryPrj(HttpContext context) { //接受前端传递参数和数据 st ...
RabbitMQ：消息发送确认与消息接收确认（ACK）
默认情况下如果一个 Message 被消费者所正确接收则会被从 Queue 中移除如果一个 Queue 没被任何消费者订阅,那么这个 Queue 中的消息会被 Cache(缓存),当有消费者订阅时则 ...
magento新增商品属性以及将属性加入Flat table
magento的EAV模型非常强大且灵活,但是如果不做优化的话,性能会非常低,因为attributes都存放在附表里,要获取一个entity的attribute,需要表联结一次,如果需要获取多条att ...
[转]Jetson TX1 开发教程（1）配置与刷机
开箱 Jetson TX1是英伟达公司新出的GPU开发板,拥有世界上先进的嵌入式视觉计算系统,提供高性能.新技术和极佳的开发平台.在进行配置和刷机工作之前,先来一张全家福: 可以看到,Jetson T ...
软件License设计
如何保护软件版权,最常用的办法就是设计一套license验证框架. 1.我们的常规需求如下: .可以限制软件只能在一台机器上使用: 目前很多软件都是一机一码的销售,软件换一台机器则不能使用,想要几台机 ...

爬取代理IP，并判断是否可用。

爬取代理IP，并判断是否可用。的更多相关文章

随机推荐

热门专题