（转）Python爬虫--通用框架

转自https://blog.csdn.net/m0_37903789/article/details/74935906

前言：

相信不少写过Python爬虫的小伙伴，都应该有和笔者一样的经历吧_{只要确定了要爬取的目标，就开始疯狂的写代码，写脚本}经过一番努力后，爬取到目标数据；但是回过头来，却发现自己所代码复用性小，一旦网页发生了更改，我们也不得不随之更改自己的代码，而却自己的程序过于脚本化，函数化，没有采用OPP的思维方式；没有系统的框架或结构。

指导老师看了笔者的爬虫作品后，便给出了以下三点建议：

（1）爬虫爬取的数据根据需要存数据库或直接写入.csv文件；

（2）爬虫程序包括控制程序、URL调度器、页面加载器、页面分析器、数据处理器等，尽量用OOP的思想，写成类，便于扩充，而不要直接全写成脚本；

（3）控制程序最好使用一个用户界面，用于设置开始爬取的页面、数据存放位置、显示爬取情况等。

由于笔者知识和能力有限，刚听到这些建议时，很难明白他的意思，而笔者还偏执的认为既然已经成功的爬取到目标数据，也就没什么要做的啦，已经OK啦_{直到昨天看了这个http://www.imooc.com/learn/563关于Python爬虫的课程后，才彻底的理解了老师教的}课程里系统的讲解了爬虫应有的框架和结构，使笔者收益匪浅，故在此总结，反思，希望对大家有帮助。

这里先为它，打个小广告吧~笔者个人认为，不管你是资深的Python爬虫专家，还是才接触爬虫的新手，都应该来看一看，为你以后的Python爬虫工作添砖加瓦，广告语“慕课网—程序员的梦工厂”。

PS:以下截图，为笔者再听课时截图整理所得，故图片来源该课程的PPT

基于百度百科词条，通用爬虫源码：https://github.com/NO1117/baike_spider

Python交流群：942913325 欢迎大家一起交流学习

总结：

1.爬虫思路

如上图所示，一般在开始爬虫时，都会经历这样的思考过程，其中最为主要和关键的分析目标，只有经过准确的分析和前期的充分准备，才能顺顺利利的爬取到目标数据。

2.爬虫任务：

3.爬虫的框架及运行流程图

接下来，就一起学习一下Python爬虫的框架吧~

爬虫的大致运行过程如下：

4.URL管理器

所谓的URL管理器，主要是由两个集合构成（待抓取URL集合和已抓取URL集合），其目的是为了防止重复抓取，循环抓取；

URL管理器的实现方式，分三种：a,Python内存（即集合）；b,数据库（如MySQL，MongoDB等）；c,缓存数据库

5.网页下载器

所谓网页下载器，即是将互联网上URL对应的网页下载到本地的工具

网页下载器，大致为request和urllib2两种;

6.网页解析器

什么是网页解析器？

下面，我们来看看，如何解析一个网页文件

解析器种类：

好了，通过以上的学习，我们掌握了Python爬虫的简单框架。那么怎样才能写一个好的python爬虫呢？又该如何去编写代码，实现我们的爬虫功能呢？下一步又该如何优化我们的爬虫代码呢？

（转）Python爬虫--通用框架的更多相关文章

python爬虫scrapy框架——人工识别登录知乎倒立文字验证码和数字英文验证码(2)
操作环境:python3 在上一文中python爬虫scrapy框架--人工识别知乎登录知乎倒立文字验证码和数字英文验证码(1)我们已经介绍了用Requests库来登录知乎,本文如果看不懂可以先看之前 ...
Python爬虫Scrapy框架入门（0）
想学习爬虫,又想了解python语言,有个python高手推荐我看看scrapy. scrapy是一个python爬虫框架,据说很灵活,网上介绍该框架的信息很多,此处不再赘述.专心记录我自己遇到的问题 ...
python爬虫----scrapy框架简介和基础应用
Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架. 其可以应用在数据挖掘,信息处理或存储历史数据等一系列的程序中.其最初是为了页面抓取 (更确切来说, 网络抓取 )所设计的, 也可以 ...
Python爬虫-pyspider框架的使用
pyspider 是一个用python实现的功能强大的网络爬虫系统,能在浏览器界面上进行脚本的编写,功能的调度和爬取结果的实时查看,后端使用常用的数据库进行爬取结果的存储,还能定时设置任务与任务优 ...
Python 爬虫-Scrapy框架基本使用
2017-08-01 22:39:50 一.Scrapy爬虫的基本命令 Scrapy是为持续运行设计的专业爬虫框架,提供操作的Scrapy命令行. Scrapy命令行格式 Scrapy常用命令采用 ...
Python爬虫 ---scrapy框架初探及实战
目录 Scrapy框架安装操作环境介绍安装scrapy框架(linux系统下) 检测安装是否成功 Scrapy框架爬取原理 Scrapy框架的主体结构分为五个部分: 它还有两个可以自定义下载功能的 ...
python爬虫scrapy框架
Scrapy 框架关注公众号"轻松学编程"了解更多. 一.简介 Scrapy是用纯Python实现一个为了爬取网站数据.提取结构性数据而编写的应用框架,用途非常广泛. 框架的力量 ...
Python爬虫Scrapy框架入门（2）
本文是跟着大神博客,尝试从网站上爬一堆东西,一堆你懂得的东西附上原创链接: http://www.cnblogs.com/qiyeboy/p/5428240.html 基本思路是,查看网页元素,填写 ...
Python爬虫Scrapy框架入门（1）
也许是很少接触python的原因,我觉得是Scrapy框架和以往Java框架很不一样:它真的是个框架. 从表层来看,与Java框架引入jar包.配置xml或.property文件不同,Scrapy的模 ...

随机推荐

Docker构建mysql主从
一.为什么要搭建主从架构呢 1.数据安全,可以进行数据的备份. 2.读写分离,大部分的业务系统来说都是读数据多,写数据少,当访问压力过大时,可以把读请求给到从服务器.从而缓解数据库访问的压力 3.故障 ...
12.10File类
要点提示:File类包含了获得一个文件/目录的属性,以及对文件/目录进行改名和删除的方法. 在文件系统中,每个文件都存放在一个目录下.绝对文件名,是由文件名和它的完整路径以及驱动器字母组成.例如,c: ...
idea中IDEA优化配置
进入IDEA 设置.两种方法: 1,File -> Settings 2,工具栏有个工具按钮点下(假如没工具栏,View -> 选下Toolbar) 进入设置页面,从上到下,主要是外观 ...
Leetcode No.136 Single Number(c++实现）
1. 题目 1.1 英文题目 Given a non-empty array of integers nums, every element appears twice except for one. ...
interpration
On interpreting the effects of repetition interpreting 释意1. If you interpret something in a particul ...
「AGC025D」 Choosing Points
「AGC025D」 Choosing Points 神仙构造题. 首先你会尝试暴力做,先随便选一个点,然后把当前能选得全选上,然后你发现这样样例都过不了. 然后我们可以这样考虑:你把距离为 \(\sq ...
Django基础009--Paginator分页
1.引入 from django.core.paginator import Paginator 2.Paginator对象提供的方法 articles = models.Article.object ...
[刘阳Java]_BeanNameViewResolver视图解析器_第8讲
BeanNameViewResolver:这个视图解析器跟XmlViewResolver有点类似,也是通过把返回的逻辑视图名称去匹配定义好的视图bean对象.它要求视图bean对象都定义在Spring ...
JavaScript学习笔记：你必须要懂的原生JS（一）
1.原始类型有哪几种?null是对象吗?原始数据类型和复杂数据类型存储有什么区别? 原始类型有6种,分别是undefined,null,bool,string,number,symbol(ES6新增) ...
Laravel 6 – 搭建管理后台的用户认证“脚手架”工具
1. 下载Laravel/ui 命令: composer require laravel/ui "^1.0" -dev 注意laravel framework 6只支持版本1的la ...

（转）Python爬虫--通用框架

（转）Python爬虫--通用框架的更多相关文章

随机推荐

热门专题