scrapy爬虫系列之开头--scrapy知识点

介绍：Scrapy是一个为了爬取网站数据、提取结构性数据而编写的应用框架，我们只需要实现少量的代码，就能够快速抓取。
Scrapy使用了Twisted异步网络框架，可以加快我们的下载速度。

0、说明：
　　保存数据的方法有4种(json、jsonl、csv、xml)，-o 输出指定格式的文件
　　scrapy crawl 爬虫名称 -o aa.json
　　在编写Spider时，如果返回的不是item对象，可以通过scrapy crawl 爬虫名称 -o aa.json 爬取数据输出到本地，保存为aa.json文件

1、使用步骤
　　1.1 新建项目：scrapy startproject xxx
　　1.2 生成爬虫：scrapy genspider aaa "http://www.aaa.com"
　　1.3 明确目标：编写items.py，明确要提取的数据
　　1.4 编写爬虫：spiders/xx.py，编写爬虫文件，处理请求和响应，以及提取数据（yield item）
　　1.5 存储内容：pipelines.py，编写管道文件，处理spider返回的item数据
　　1.6 设置配置：settings.py，启动管道组件，以及其他相关配置
　　1.7 执行爬虫：scrapy aaa 爬虫名称

2、安装：
　　pip3 install scrapy

3、命令
　　scrapy bench 测试
　　scrapy fetch "http://www.baidu.com" 爬取页面
　　scrapy genspider 爬虫名称 'http://www.baidu.com' 生成一个爬虫
　　scrapy runspider 运行一个爬虫
　　scrapy shell "url地址" 发送完请求后，用shell交互读取响应内容
　　　　response.body 响应体，response.body.decode()
　　　　response.headers 报头
　　　　response.selector Selector对象，此时可以通过response.selector.xpat() 或response.selector.css()来对response进行查询，或者把中间的selector省略也可以使用（新版）
　　　　Selector选择器，有4个基本的方法，最常用xpath
　　　　　　xpath()，传入xpath表达式，返回该表达式所对应的所有结点的selector list列表，使用方式：response.xpath("表达式")
　　　　　　extract()，序列化该结点为Unicode字符串并返回列表
　　　　　　css()，插入css表达式，返回该表达式所对应的所有结点的selector list列表，语法同 bs4
　　　　　　re()，根据传入的正则表达式进行提取，返回Unicode字符串列表

　　scrapy startproject 创建项目
　　scrapy list 查看项目下有多少个爬虫

4、其他
　　CrawlSpider

5、使用pipeline
　　可以有多个，为什么要有多个？
　　　　不同的pipeline处理不同的item的内容
　　　　一个spider的内容可能要做不同的操作，比如存入不同的数据库中
　　5.1 一个爬虫项目，包含多个爬虫，爬取多个网站，可以建多个Spider
　　5.2 当有多个爬虫，一个pipeline时，如何操作不同的数据呢？
　　　　可以在爬虫返回item时，加：item["come_from"] = '网站1'，然后在pipeline的process_item方法里进行判断：if item["come_from"] == '网站1': do something
　　　　或者，根据spider.name来进行判断是哪个spider返回的数据

6、日志logging
　　普通用法：
　　　　import logging
　　　　logging.warning()
　　scrapy中的用法：
　　　　settings里配置日志级别：LOG_LEVEL = "WARNING"
　　　　settings里配置日志存放位置：LOG_FILE = './log.log' 当前目录
　　普通py项目的日志用法
　　　　import logging
　　　　logging.basicConfig(filename='example.log',level=logging.DEBUG) #还有很多参数可以设置
　　　　logger = logging.getLogger(__name__)
　　　　logger.warning("ssssssssss")

scrapy爬虫系列之开头--scrapy知识点的更多相关文章

[Python爬虫] scrapy爬虫系列 <一>.安装及入门介绍
前面介绍了很多Selenium基于自动测试的Python爬虫程序,主要利用它的xpath语句,通过分析网页DOM树结构进行爬取内容,同时可以结合Phantomjs模拟浏览器进行鼠标或键盘操作.但是,更 ...
爬虫系列2：scrapy项目入门案例分析
本文从一个基础案例入手,较为详细的分析了scrapy项目的建设过程(在官方文档的基础上做了调整).主要内容如下: 0.准备工作 1.scrapy项目结构 2.编写spider 3.编写item.py ...
scrapy爬虫系列之七--scrapy_redis的使用
功能点:如何发送携带cookie访问登录后的页面,如何发送post请求登录简单介绍: 安装:pip3 install scrapy_redis 在scrapy的基础上实现了更多的功能:如reques ...
scrapy爬虫系列之六--模拟登录
功能点:如何发送携带cookie访问登录后的页面,如何发送post请求登录爬取网站:bilibili.github 完整代码:https://files.cnblogs.com/files/book ...
scrapy爬虫系列之五--CrawlSpider的使用
功能点:CrawlSpider的基本使用爬取网站:保监会主要代码: cf.py # -*- coding: utf-8 -*- import scrapy from scrapy.linkextr ...
scrapy框架系列 (1) 初识scrapy
Scrapy 框架 Scrapy是用纯Python实现一个为了爬取网站数据.提取结构性数据而编写的应用框架,用途非常广泛. 框架的力量,用户只需要定制开发几个模块就可以轻松的实现一个爬虫,用来抓取网页 ...
爬虫系列4：scrapy技术进阶之多页面爬取
多页面爬取有两种形式. 1)从某一个或者多个主页中获取多个子页面的url列表,parse()函数依次爬取列表中的各个子页面. 2)从递归爬取,这个相对简单.在scrapy中只要定义好初始页面以及爬虫规 ...
爬虫系列3：scrapy技术进阶（xpath、rules、shell等）
本文主要介绍与scrapy应用紧密相关的关键技术,不求很深入,但求能够提取要点.内容包括: 1.xpath选择器:选择页面中想要的内容 2.rules规则:定义爬虫要爬取的域 3.scrapy she ...
scrapy爬虫系列之一--scrapy的基本用法
功能点:scrapy基本使用爬取网站:传智播客老师完整代码:https://files.cnblogs.com/files/bookwed/first.zip 主要代码: ff.py # -*- ...

随机推荐

在系统中使用read函数读取文件内容
read函数(读取文件) read函数可以读取文件.读取文件指从某一个已打开地文件中,读取一定数量地字符,然后将这些读取的字符放入某一个预存的缓冲区内,供以后使用. 使用格式如下: number = ...
hoj Counting the algorithms
贪心加树状数组给出的数据可能出现两种情况,包括与不包括,但我们从右向左删就能避免这个问题. #include<stdio.h> #include<string.h> #inc ...
RSQLite 操作sqlite数据库
RSQLite 可以在R中方便的创建sqlite数据库,并进行检索, 这个R包依赖于DBI包 github 上的地址:https://github.com/rstats-db/RSQLite gith ...
php把时间戳转换成英文格式
<?php echo "时间格式1:".date("Y-m-d H:i:s ")."<br>";// 2010-06-12 ...
vc 获取硬盘序列号和 cpu
vc 获取硬盘序列号和 cpu 唯一iD的方法?如题---------网上找来很多资料也没找到, 要支持xp win7 32/64 系统下都能获取硬盘序列号和cpu ID 哪位朋友帮帮忙: ...
消息中间件-ActiveMQ入门实例
1.下载ActiveMQ: http://activemq.apache.org/download-archives.html 2.运行ActiveMQ 解压缩apache-activemq-5.5. ...
bootstrap 标签页tab切换js（含报错原因）
booststrap 标签页的tab切换,相信大家已经都很熟悉了,在boot官网示例以及其他网站已经很多罗列相关代码的了,这里就不赘述了.这里主要贴下让boot标签页默认显示哪个标签页的js. 主要留 ...
css hack整理 (摘)
CSS Hack Table Y 渲染 N 不渲染 H 部分版本或部分属性渲染 B 样式失效 windows Mobile Linux Mac IE Firefox Chrome Safa ...
parameter "timeout" in socketchannel does not work
// Accept the connection and make it non-blocking SocketChannel socketChannel = serverSocketChannel. ...
js中如何跳出循环
1.for循环中我们使用continue:终止本次循环计入下一个循环,使用break终止整个循环. 2.而在jquery中 $.each使用return true 终止本次循环计入下一个循环,retu ...

scrapy爬虫系列之开头--scrapy知识点

scrapy爬虫系列之开头--scrapy知识点的更多相关文章

随机推荐

热门专题