Python网络爬虫笔记（二）：链接爬虫和下载限速

（一）代码1（link_crawler()和get_links()实现链接爬虫）

 import urllib.request as ure

 import re

 import urllib.parse

 from delayed import WaitFor

 #下载网页并返回HTML(动态加载的部分下载不了)

 def download(url,user_agent='Socrates',num=2):

     print('下载:'+url)

     #设置用户代理

     headers = {'user_agent':user_agent}

     request = ure.Request(url,headers=headers)

     try:

         #下载网页

         html = ure.urlopen(request).read()

     except ure.URLError as e:

         print('下载失败'+e.reason)

         html=None

         if num>0:

             #遇到5XX错误时，递归调用自身重试下载，最多重复2次

             if hasattr(e,'code') and 500<=e.code<600:

                 return download(url,num-1)

     return html

 #seed_url传入一个url

 #link_regex传入一个正则表达式

 #函数功能：提取和link_regex匹配的所有网页链接并下载

 def link_crawler(seed_url, link_regex):

     html = download(seed_url)

     crawl_queue = []

     #迭代get_links（）返回的列表，将匹配正则表达式link_regex的链接添加到列表中

     for link in get_links(html):

         if re.match(link_regex, link):

             #拼接https://www.cnblogs.com/ 和 /cate/...

             link = urllib.parse.urljoin(seed_url, link)

             #不在列表中才添加

             if link not in crawl_queue:

                 crawl_queue.append(link)

     #调用WaitFor的wait（）函数，下载限速，间隔小于2秒则等待，直到时间等于2秒才继续下载（大于则直接继续下载）

     waitFor = WaitFor(2)

     #下载crawl_queue中的所有网页

     while crawl_queue:

         #删除列表末尾的数据

         url = crawl_queue.pop()

         waitFor.wait(url)

         download(url)

 #传入html对象，以列表形式返回所有链接

 def get_links(html):

     #使用正则表达式提取html中所有网页链接

     webpage_regex = re.compile('<a[^>]+href=["\'](.*?)["\']',re.IGNORECASE)

     html = html.decode('utf-8')

     # 以列表形式返回所有网页链接

     return webpage_regex.findall(html)

 link_crawler('https://www.cnblogs.com/','/cate/.*')

（二）delayed.py（实现下载限速的类）

 import urllib.parse

 import datetime

 import time

 class WaitFor():

     def __init__(self,delay):

         #delay：希望延迟多长时间（wait（）中的处理是以秒为单位）

         self.delay = delay

         #用来存放上次下载时间

         self.domains = dict()

     def wait(self,url):

         #获取url netloc属性的值（即www.cnblogs.com，// 和第一个 /之间的内容）

         domain = urllib.parse.urlparse(url).netloc

         #存在键值为domain的数据返回value值，否则返回None

         last_down = self.domains.get(domain)

         if self.delay >0 and last_down is not None:

             #  希望延迟时间 - （当前时间-上次下载时间），seconds时间间隔以秒为单位显示

             sleep_sec = self.delay-(datetime.datetime.now()-last_down).seconds

             if sleep_sec > 0:

                 time.sleep(sleep_sec)

         #将当前时间添加到domains中

         self.domains[domain] = datetime.datetime.now()

Python网络爬虫笔记（二）：链接爬虫和下载限速的更多相关文章

Python网络编程笔记二
使用select模块实现IO多路复用服务端 import socket import select #windows上只支持select.select,不支持poll epoll HOST = &qu ...
2.Python爬虫入门二之爬虫基础了解
1.什么是爬虫爬虫,即网络爬虫,大家可以理解为在网络上爬行的一直蜘蛛,互联网就比作一张大网,而爬虫便是在这张网上爬来爬去的蜘蛛咯,如果它遇到资源,那么它就会抓取下来.想抓取什么?这个由你来控制它咯. ...
Python爬虫入门二之爬虫基础了解
1.什么是爬虫爬虫,即网络爬虫,大家可以理解为在网络上爬行的一直蜘蛛,互联网就比作一张大网,而爬虫便是在这张网上爬来爬去的蜘蛛咯,如果它遇到资源,那么它就会抓取下来.想抓取什么?这个由你来控制它咯. ...
转 Python爬虫入门二之爬虫基础了解
静觅 » Python爬虫入门二之爬虫基础了解 2.浏览网页的过程在用户浏览网页的过程中,我们可能会看到许多好看的图片,比如 http://image.baidu.com/ ,我们会看到几张的图片以 ...
Python网络数据采集PDF高清完整版免费下载|百度云盘
百度云盘:Python网络数据采集PDF高清完整版免费下载提取码:1vc5 内容简介本书采用简洁强大的Python语言,介绍了网络数据采集,并为采集新式网络中的各种数据类型提供了全面的指导.第 ...
Python网络爬虫笔记（五）：下载、分析京东P20销售数据
(一) 分析网页下载下面这个链接的销售数据 https://item.jd.com/6733026.html#comment 1. 翻页的时候,谷歌F12的Network页签可以看到下面 ...
nodejs爬虫笔记(二)---代理设置
node爬虫代理设置最近想爬取YouTube上面的视频信息,利用nodejs爬虫笔记(一)的方法,代码和错误如下 var request = require('request'); var chee ...
python之爬虫（二）爬虫的原理
在上文中我们说了:爬虫就是请求网站并提取数据的自动化程序.其中请求,提取,自动化是爬虫的关键!下面我们分析爬虫的基本流程爬虫的基本流程发起请求通过HTTP库向目标站点发起请求,也就是发送一个Req ...
Python 网络编程（二）
Python 网络编程上一篇博客介绍了socket的基本概念以及实现了简单的TCP和UDP的客户端.服务器程序,本篇博客主要对socket编程进行更深入的讲解一.简化版ssh实现这是一个极其简单 ...
Python网络编程基础|百度网盘免费下载|零基础入门学习资料
百度网盘免费下载:Python网络编程基础|零基础学习资料提取码:k7a1 目录: 第1部分底层网络第1章客户/服务器网络介绍第2章网络客户端第3章网络服务器第4章域名系统第5章 ...

随机推荐

走进webpack（2）--第三方框架（类库）的引入及抽离
在当代的前端开发中,很少会用原生JS来开发页面,最基本的都会使用jQuery来节省我们开发的时间和效率,而angular,vue,react的出现更是为前端开发者带来了福音.那么这篇文章就说说如何用w ...
Leetcode 3——Palindrome Number(回文数）
Problem: Determine whether an integer is a palindrome. Do this without extra space. 简单的回文数,大一肯定有要求写过 ...
201621123025《Java程序设计》第1周学习总结
201621123025<Jave程序设计>第一周学习总结 1.本章学习总结对于java这门课程,如果不会编码那么会很难学会如何去使用它,而在大一的一二学期的专业课--C语言和数据结构我 ...
defaultdict使用及__missing__理解
import collections import re WORD_RE = re.compile(r'\w+') index = collections.defaultdict(list) #用li ...
android头像选择（拍照，相册，裁剪）
组织头像上传时候,不兼容android6.0,并且 imageview.setImageBitmap(BitmapFactory.decodeFile(IMAGE_FILE_LOCATION));// ...
HTTP协议以及HTTP2.0/1.1/1.0区别
HTTP协议以及HTTP2.0/1.1/1.0区别一.简介摘自百度百科: 超文本传输协议(HTTP,HyperText Transfer Protocol)是互联网上应用最为广泛的一种网络协议.所 ...
css变化代码2
<!DOCTYPE html><html> <head> <meta charset="utf-8" /> ...
nyoj 数的长度
描述 N!阶乘是一个非常大的数,大家都知道计算公式是N!=N*(N-1)······*2*1.现在你的任务是计算出N!的位数有多少(十进制)? 输入首行输入n,表示有多少组测试数据(n<1 ...
JAVA_SE基础——56.包的创建
接下来我来给大家讲下--包 , 先看一段代码 class Demo1{ public static void main(String[] args) { System.out.println(&quo ...
IntelliJ IDEA sass环境配置及常见报错处理
1.下载安装ruby,网上教程很多的,安装完之后在命令行输入ruby -v检查一下是否安装成功了.(注意安装的时候要勾选第二项).

Python网络爬虫笔记（二）：链接爬虫和下载限速

Python网络爬虫笔记（二）：链接爬虫和下载限速的更多相关文章

随机推荐

热门专题