爬虫关于ip管理池的应用

在爬虫的时候经常会遇到一个问题就是ip被封，由于ip对网站的短时间大量请求，让网站将我们的ip暂时封掉。这样我们就无法全部爬取自己想要的内容。

这里百度了一下解决办法，很多人都提到了ip代理管理池的问题，其大致思想就是在一些网站上找一些免费的ip代理，然后将他们放入一个列表中，这样我们就可以用这些免费的ip代理来不断更换，每当一个ip被封后我们就用代码调用下一个ip代理，直到我们爬完我们想要的数据。

大致思路如下:(这里我用Python来讲)

　　1.访问一个国内免费ip代理的网站(注意要获取高匿的ip)，这里我们以网站有代理(http://www.youdaili.net/）为例，进入后找到http代理点击进入，然后点击列表中最新日期的免费代理，就可以看到很多最新的免费ip代理

　　2.用Python的BeautifulSoup解析这个页面，从页面中获取所有的ip地址及端口号，组合(ip:port的形式)起来存入一个列表中，

　　3.获得了所有的ip后，接下来我么要验证这些ip能不能用，因为免费的ip代理大部分都是不能用的，所以我们就要从这些在网页上爬取的ip进行检查，去掉那些不能用的，具体方法是(注意一点Python中代理参数的格式是proxy=　　{'http':'http://ip:port'})：首先我们将ip配置为Python中代理参数的默认格式，然后我们用urllib.request.ProxyHandler方法将proxy传入，接着用urllib.request.build.opener和urllib.request.install_opener()一次处理，代理参数就配置好了，然后我们以百度为测试网站，测试看看我们的代理ip能不能，用urllib.request.urlopen()如果能返回则证明可用反之不能用。能用的话我们就添加到一个新的列表中加一保存

　　注:出入讲解的缘故，一下代码只爬取的免费代理网站上面的首页所有ip和port，至于翻页什么的大家应该可以自己搞定

代码如下:

import urllib.request

from bs4 import BeautifulSoup

#访问免费ip代理网址:http://www.youdaili.net/Daili/http/29381.html,处理得到所有的ip

def htmlParser(url):

    iplist=[]

    #设置头部

    user_agent = 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/49.0.2623.22 Safari/537.36 SE 2.X MetaSr 1.0'

    headers = {"User-Agent": user_agent}

    req = urllib.request.Request(url, headers=headers)

    #获取页面html

    html=urllib.request.urlopen(req).read()

    soup=BeautifulSoup(html,'html.parser')

    datas=soup.find("div",{"class":"content"}).findAll("p")

    for data in datas:

        ip=data.get_text().split("@")[0]

        iplist.apend(ip)

    return iplist

#检测ip是否可用

def confirm_ip(ip):

    #配置proxy

    proxy={'http':'http://%s'%ip}

    proxy_handler=urllib.request.ProxyHandler(proxy)

    proxy=urllib.request.bulid_handler(proxy_handler)

    urllib.request.install_handler(proxy)

    #用百度首页检测代理ip

    test_url="http://www.baidu.com"

    user_agent = 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/49.0.2623.22 Safari/537.36 SE 2.X MetaSr 1.0'

    headers = {"User-Agent": user_agent}

    req = urllib.request.Request(test_url, headers=headers)

    try:

        response=urllib.request.urlopen(req)

        content=response.read()

        #获取到内容

        if content：

            print("its a right ip")

            return ip

        #没有获取到

        else:

            return None

    #访问错误

    except urllib.request.URLError as e:

        print(e.reason)

        return None

trueIp=[]

url="http://www.youdaili.net/Daili/http/29381.html"

iplist=htmlParse(url)

for ip in iplist；

    if confirm_ip(ip)!=None:

       trueIp.append(ip)

print(trueIp)

好了内容就是这么都，有不妥的地方欢迎大家交流.（吐槽一下：博客园编辑器好垃圾,第一次徒手在自带的编辑器上写，写完了看到下面一个换色，一点所有代码不见了!产品经理把这个功能改一下吧！加个提醒也行啊！！）

爬虫关于ip管理池的应用的更多相关文章

Python爬虫之ip代理池
可能在学习爬虫的时候,遇到很多的反爬的手段,封ip 就是其中之一. 对于封IP的网站.需要很多的代理IP,去买代理IP,对于初学者觉得没有必要,每个卖代理IP的网站有的提供了免费IP,可是又很少,写了 ...
记一次企业级爬虫系统升级改造（六）：基于Redis实现免费的IP代理池
前言: 首先表示抱歉,春节后一直较忙,未及时更新该系列文章. 近期,由于监控的站源越来越多,就偶有站源做了反爬机制,造成我们的SupportYun系统小爬虫服务时常被封IP,不能进行数据采集. 这时候 ...
反爬虫之搭建IP代理池
反爬虫之搭建IP代理池听说你又被封 ip 了,你要学会伪装好自己,这次说说伪装你的头部.可惜加了header请求头,加了cookie 还是被限制爬取了.这时就得祭出IP代理池!!! 下面就是requ ...
ip代理池的爬虫编写、验证和维护
打算法比赛有点累,比赛之余写点小项目来提升一下工程能力.顺便陶冶一下情操本来是想买一个服务器写个博客或者是弄个什么FQ的东西最后刷知乎看到有一个很有意思的项目,就是维护一个「高可用低延迟的高匿IP ...
python3爬虫系列19之反爬随机 User-Agent 和 ip代理池的使用
站长资讯平台:python3爬虫系列19之随机User-Agent 和ip代理池的使用我们前面几篇讲了爬虫增速多进程,进程池的用法之类的,爬虫速度加快呢,也会带来一些坏事. 1. 前言比如随着我们爬虫 ...
【python3】如何建立爬虫代理ip池
一.为什么需要建立爬虫代理ip池在众多的网站防爬措施中,有一种是根据ip的访问频率进行限制的,在某段时间内,当某个ip的访问量达到一定的阀值时,该ip会被拉黑.在一段时间内被禁止访问. 这种时候,可 ...
建立爬虫代理IP池
单线程构建爬虫代理IP池 #!/usr/bin/python3.5 # -*- coding:utf-8 -*- import time import tempfile from lxml impor ...
python爬虫实战（三）--------搜狗微信文章（IP代理池和用户代理池设定----scrapy）
在学习scrapy爬虫框架中,肯定会涉及到IP代理池和User-Agent池的设定,规避网站的反爬. 这两天在看一个关于搜狗微信文章爬取的视频,里面有讲到ip代理池和用户代理池,在此结合自身的所了解的 ...
python爬虫18 | 就算你被封了也能继续爬，使用IP代理池伪装你的IP地址，让IP飘一会
我们上次说了伪装头部 ↓ python爬虫17 | 听说你又被封 ip 了,你要学会伪装好自己,这次说说伪装你的头部让自己的 python 爬虫假装是浏览器小帅b主要是想让你知道在爬取网站的时候 ...

随机推荐

erlang mnesia数据库简单应用
mnesia是erlang自带的分布式数据库,基于ets和dets实现的.mnesia兼顾了dets的持久性和ets的高性能,可以自动在多个erlang节点间同步数据库.最关键的是,mnesia实现了 ...
Dotfuscator类重命名方法解析
Dotfuscator是专业的.NET程序代码混淆工具,拥有重命名.字符串加密.流程模糊.自定义规则和水印等功能,倍受开发人员喜爱.其中类重命名的使用方法非常普遍,涉及到既要保护代码信息,又要在以后能 ...
使用Windows2003创建DNS服务器 - 进阶者系列 - 学习者系列文章
Windows 2003的DNS服务器的配置还是比较简单的.下面简要介绍下DNS服务器的配置. 1. 打开控制面板,选择添加删除Windows组件,选择网络服务 ,选择详细信息,选择域名 ...
css3中webkit-box的用法（平分父元素）
display:box;box-flex是css3新添加的盒子模型属性,它的出现可以解决我们通过N多结构.css实现的布局方式.经典的一个布局应用就是布局的垂直等高.水平均分.按比例划分.目前box- ...
Asp.Net Web Api 接口，拥抱支持跨域访问。
如何让你的 Asp.Net Web Api 接口,拥抱支持跨域访问. 由于 web api 项目通常是被做成了一个独立站点,来提供数据,在做web api 项目的时候,不免前端会遇到跨域访问接口的问题 ...
mvc上传头像加剪裁功能
asp.net mvc上传头像加剪裁功能正好项目用到上传+剪裁功能,发上来便于以后使用. 我不能告诉你们其实是从博客园扒的前台代码,哈哈. 前端是jquery+fineuploader+jquery ...
在Linux使用GCC编译C语言共享库
在Linux使用GCC编译C语言共享库对任何程序员来说库都是必不可少的.所谓的库是指已经编译好的供你使用的代码.它们常常提供一些通用功能,例如链表和二叉树可以用来保存任何数据,或者是一个特定的功能例 ...
uva 305 Joseph
点击打开链接uva 305 思路: 数学+打表分析: 1 传统的约瑟夫问题是给定n个人和m,每次数m次把当前这个人踢出局,问最后留下的一个人的编号 2 这一题是前k个人是好人,后面k个是坏人.现在要 ...
win32多线程-异步过程调用(asynchronous Procedure Calls, APCs)
使用overlapped I/O并搭配event对象-----win32多线程-异步(asynchronous) I/O事例,会产生两个基础性问题. 第一个问题是,使用WaitForMultipleO ...
delphi中设置系统时间方法
procedure TMainFrm.Timer1Timer(Sender: TObject); var systemtime:Tsystemtime; dt:TDateTime; begin ...

爬虫关于ip管理池的应用

爬虫关于ip管理池的应用的更多相关文章

随机推荐

热门专题