python之scrapy框架基础搭建

一、创建工程

#在命令行输入
scrapy startproject xxx　　#创建项目

二、写item文件

#写需要爬取的字段名称

name = scrapy.Field()　　#例

三、进入spiders写爬虫文件

①直接写爬虫文件自己手动命名

        新建一个.py文件即可
②通过命令方式创建爬虫文件

        scrapy gensipder yyy "xxx.com"

        命名不能于工程名相同，爬取的域名区域

四、写爬虫文件

start_urls    #爬虫第一次执行时爬取的网址域

初始换模型对象
iteam = TencentItem()    #将iteam文件引入

iteam['xxx']= each.xpath("./td[1]/a/text()").extract()[0]    
#xpath返回选择性的列表，extract将其转换成字符串，再取出列表中的第一个字符。

yield iteam    #放到管道文件

#由于爬取的页面不止一页，所以需要调用请求回调函数。

#将请求重新发送给调度器入队列，出队列，交给下载器下载

#每次处理完一页的页面请求后，发送下一页的页面请求

yield scrapy.Request(url, callback=self.parse, dont_filter=True)    
#函数名parse,有请求才会触发回调函数，yield发送到调度器 
//写在每次循环执行完的外面。

五、写管道文件

首先定义初始化方法

        def __init__(self):

            self.filename=open("xxx", "w")

    def process_item(self, iteam, spider):

        dict(iteam)    #字典转换成python的格式

        json.dumps(dict(iteam), ensure_ascii = False) + "\n"    #转换成json格式

        self.filename.write(text.encode("utf-8"))    #如果出现无法写入问题，要加上.encode("utf-8")

        return iteam

    关闭文件

        def close_spider(self, spider):

            self.filename.close()

六、配置settings文件
找到ITEM_PIPELINES配置项，配置到管道文件

七、设置请求报头
在settings文件中找到DEFAULT_REQUEST_HEADERS配置

八、运行程序

scrapy crawl 文件名

crawlspider创建应用改写

一、创建工程

scrapy gensipder -t crawl tencent tencent.com

    #导入crawlspider类和rule规则

    #from scrapy.spider import CrawlSpider, Rule

    #导入链接规则匹配类，用来提取符合规则的链接

    #from scrapy.linkextractors import LinkExtractor

    #from TencentSpider.items import TencentItem

    class TencentSpider(CrawlSpider):    #继承CrawlSpider类

        name = "xxx"    #爬虫名

        allow_domains = []    #控制爬虫的爬取域

        start_urls = []

        #正则匹配规则，Response里页面信息中符合规则的数据

        pagelink = LinkExtractor(allow=("start=\d+"))

        #批量调用请求方法

        rules = [

            #pagelink=url, 跟进链接调用方法，是否跟进链接True

            Rule(pagelink, callback = "parseTencent", follow = True)

        ]

斗鱼

    将json格式转换成python格式，data段是列表

    data = json.loads(response.text['data']

python之scrapy框架基础搭建的更多相关文章

python爬虫scrapy框架——人工识别登录知乎倒立文字验证码和数字英文验证码(2)
操作环境:python3 在上一文中python爬虫scrapy框架--人工识别知乎登录知乎倒立文字验证码和数字英文验证码(1)我们已经介绍了用Requests库来登录知乎,本文如果看不懂可以先看之前 ...
Python爬虫Scrapy框架入门（0）
想学习爬虫,又想了解python语言,有个python高手推荐我看看scrapy. scrapy是一个python爬虫框架,据说很灵活,网上介绍该框架的信息很多,此处不再赘述.专心记录我自己遇到的问题 ...
Python爬虫 ---scrapy框架初探及实战
目录 Scrapy框架安装操作环境介绍安装scrapy框架(linux系统下) 检测安装是否成功 Scrapy框架爬取原理 Scrapy框架的主体结构分为五个部分: 它还有两个可以自定义下载功能的 ...
Python爬虫Scrapy框架入门（1）
也许是很少接触python的原因,我觉得是Scrapy框架和以往Java框架很不一样:它真的是个框架. 从表层来看,与Java框架引入jar包.配置xml或.property文件不同,Scrapy的模 ...
Python使用Scrapy框架爬取数据存入CSV文件(Python爬虫实战4)
1. Scrapy框架 Scrapy是python下实现爬虫功能的框架,能够将数据解析.数据处理.数据存储合为一体功能的爬虫框架. 2. Scrapy安装 1. 安装依赖包 yum install g ...
基于python的scrapy框架爬取豆瓣电影及其可视化
1.Scrapy框架介绍主要介绍,spiders,engine,scheduler,downloader,Item pipeline scrapy常见命令如下: 对应在scrapy文件中有,自己增加 ...
爬虫入门之Scrapy 框架基础功能(九)
Scrapy是用纯Python实现一个为了爬取网站数据.提取结构性数据而编写的应用框架,用途非常广泛. 框架的力量,用户只需要定制开发几个模块就可以轻松的实现一个爬虫,用来抓取网页内容以及各种图片,非 ...
Python爬虫-- Scrapy框架
Scrapy框架 Scrapy使用了Twisted作为框架,Twisted有些特殊的地方是它是事件驱动的,并且比较适合异步的代码.对于会阻塞线程的操作包含访问文件.数据库或者Web.产生新的进程并需要 ...
python爬虫scrapy框架
Scrapy 框架关注公众号"轻松学编程"了解更多. 一.简介 Scrapy是用纯Python实现一个为了爬取网站数据.提取结构性数据而编写的应用框架,用途非常广泛. 框架的力量 ...

随机推荐

EF Core 执行SQL语句和存储过程
无论ORM有多么强大,总会出现一些特殊的情况,它无法满足我们的要求.在这篇文章中,我们介绍几种执行SQL的方法. 表结构在具体内容开始之前,我们先简单说明一下要使用的表结构. public clas ...
Docker 与 Podman 容器管理的比较
翻译自 Paul Ferrill 2020年9月1日的文章<Compare Docker vs. Podman for container management> [1] Docker 和 ...
Redis/Mysql/SQLite/MongoDB 数据库对比
一.Redis: redis是一个key-value存储系统.和Memcached类似,它支持存储的value类型相对更多,包括string(字符串).list(链表).set(集合).zset(so ...
第9.9节 Python文件随机读写定位操作方法seek
类似于C语言,Python也提供了文件位置定位的操作方法seek. 一. 语法 seek(offset, whence=SEEK_SET) 语法释义: 1)offset :将文件当前操作位置移动偏移量 ...
FM解析（因子分解机，2010）
推荐参考:(知乎) https://zhuanlan.zhihu.com/p/37963267 要点理解: 1.fm应用场景,为什么提出了fm(和lr的不同点) ctr预测,特征组合,fm的隐向量分解 ...
团队作业4-Day5
团队作业4-Day5 项目git地址 1. 站立式会议 2. 项目燃尽图 3. 适当的项目截图 4. 代码/文档签入记录(部分) 5. 每人每日总结吴梓华:补充了样式代码以方便调试. 白军强:顺利完 ...
CSMA系列区别比较：p-pCSMA;CSMA/CA;CSMA/CD
CSMA系列小结 CSMA,又称载波侦听多路访问协议.在计算机网络课程中,其一共有四个基础协议与两个实际应用(分别是802.11和802.3) 忙空闲传输冲突应用 1-p CSMA 持续侦听,等 ...
HTML5中的自定义属性data-*
在html5中,给元素添加自定义属性需要用到data-*,比如data-name,添加完data-自定义属性之后通过元素的dataset属性来访问其值. dataset与getAttribute/se ...
题解-FJOI2018 领导集团问题
题面 FJOI2018 领导集团问题给一棵树 \(T(|T|=n)\),每个点有个权值 \(w_i\),从中选出一个子点集 \(P=\{x\in {\rm node}|x\in T\}\),使得 \ ...
STL——容器（List）List 的概念
1. List 容器的基本概念 1. list 是一个双向链表容器,可高效的进行插入删除元素,他的原理在于每个元素都有两个指针来记录前后两个元素的地址,像火车车厢一样,list 中各个元素在物理存储单 ...

python之scrapy框架基础搭建

python之scrapy框架基础搭建的更多相关文章

随机推荐

热门专题