python框架Scrapy中crawlSpider的使用—

一、先在MySQL中创建test数据库，和相应的site数据表

二、创建Scrapy工程

#scrapy startproject 工程名

scrapy startproject demo4

三、进入工程目录，根据爬虫模板生成爬虫文件

#scrapy genspider -l # 查看可用模板

#scrapy genspider -t 模板名 爬虫文件名 允许的域名

scrapy genspider -t crawl test sohu.com

四、设置IP池或用户代理（middlewares.py文件）

 # -*- coding: utf-8 -*-

 # 导入随机模块

 import random

 # 导入有关IP池有关的模块

 from scrapy.downloadermiddlewares.httpproxy import HttpProxyMiddleware

 # 导入有关用户代理有关的模块

 from scrapy.downloadermiddlewares.useragent import UserAgentMiddleware

 # IP池

 class HTTPPROXY(HttpProxyMiddleware):

     # 初始化 注意一定是 ip=''

     def __init__(self, ip=''):

         self.ip = ip

     def process_request(self, request, spider):

         item = random.choice(IPPOOL)

         try:

             print("当前的IP是："+item["ipaddr"])

             request.meta["proxy"] = "http://"+item["ipaddr"]

         except Exception as e:

             print(e)

             pass

 # 设置IP池

 IPPOOL = [

     {"ipaddr": "182.117.102.10:8118"},

     {"ipaddr": "121.31.102.215:8123"},

     {"ipaddr": "1222.94.128.49:8118"}

 ]

 # 用户代理

 class USERAGENT(UserAgentMiddleware):

     #初始化 注意一定是 user_agent=''

     def __init__(self, user_agent=''):

         self.user_agent = user_agent

     def process_request(self, request, spider):

         item = random.choice(UPPOOL)

         try:

             print("当前的User-Agent是："+item)

             request.headers.setdefault('User-Agent', item)

         except Exception as e:

             print(e)

             pass

 # 设置用户代理池

 UPPOOL = [

     "Mozilla/5.0 (Windows NT 10.0; WOW64; rv:52.0) Gecko/20100101 Firefox/52.0", "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.115 Safari/537.36", "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/51.0.2704.79 Safari/537.36 Edge/14.14393"

 ]

五、settngs.py配置

 COOKIES_ENABLED = False

 DOWNLOADER_MIDDLEWARES = {

     # 'scrapy.downloadermiddlewares.httpproxy.HttpProxyMiddleware':123,

     # 'demo4.middlewares.HTTPPROXY' : 125,

     'scrapy.downloadermiddlewares.useragent.UserAgentMiddleware': 2,

     'demo4.middlewares.USERAGENT': 1

 }

 ITEM_PIPELINES = {

     'demo4.pipelines.Demo4Pipeline': 300,

 }

六、定义爬取关注的数据（items.py文件）

 # -*- coding: utf-8 -*-

 import scrapy

 # Define here the models for your scraped items

 #

 # See documentation in:

 # http://doc.scrapy.org/en/latest/topics/items.html

 class Demo4Item(scrapy.Item):

     name = scrapy.Field()

     link = scrapy.Field()

七、爬虫文件编写（test.py）

 # -*- coding: utf-8 -*-

 import scrapy

 from scrapy.linkextractors import LinkExtractor

 from scrapy.spiders import CrawlSpider, Rule

 from demo4.items import Demo4Item

 class TestSpider(CrawlSpider):

     name = 'test'

     allowed_domains = ['sohu.com']

     start_urls = ['http://www.sohu.com/']

     rules = (

         Rule(LinkExtractor(allow=('http://news.sohu.com'), allow_domains=('sohu.com')), callback='parse_item',

              follow=False),

         # Rule(LinkExtractor(allow=('.*?/n.*?shtml'),allow_domains=('sohu.com')), callback='parse_item', follow=False),

     )

     def parse_item(self, response):

         i = Demo4Item()

         i['name'] = response.xpath('//div[@class="news"]/h1/a/text()').extract()

         i['link'] = response.xpath('//div[@class="news"]/h1/a/@href').extract()

         #i['description'] = response.xpath('//div[@id="description"]').extract()

         return i

八、管道文件编写（pipelines.py）

 # -*- coding: utf-8 -*-

 import pymysql

 import json

 # Define your item pipelines here

 #

 # Don't forget to add your pipeline to the ITEM_PIPELINES setting

 # See: http://doc.scrapy.org/en/latest/topics/item-pipeline.html

 class Demo4Pipeline(object):

     def __init__(self):

         # 数据库连接

         self.conn = pymysql.connect(host='localhost', user='root', password='', database='chapter17', charset='utf8')

         self.cur = self.conn.cursor()

     def process_item(self, item, spider):

         # 排除空值

         for j in range(0, len(item["name"])):

             nam = item["name"][j]

             lin = item["link"][j]

             print(type(nam))

             print(type(lin))

             # 注意参数化编写

             sql = "insert into site(name,link) values(%s,%s)"

             self.cur.execute(sql,(nam,lin))

             self.conn.commit()

         return item

     def close_spider(self, spider):

         self.cur.close()

         self.conn.close()

九、总结

1.注意在测试完数据库正常运行时，再开始写入数据，当然，在sql参数化处理的过程中，注意格式，千万不要弄错了

python框架Scrapy中crawlSpider的使用——爬取内容写进MySQL的更多相关文章

python框架Scrapy中crawlSpider的使用
一.创建Scrapy工程 #scrapy startproject 工程名 scrapy startproject demo3 二.进入工程目录,根据爬虫模板生成爬虫文件 #scrapy genspi ...
scrapy中使用selenium来爬取页面
scrapy中使用selenium来爬取页面 from selenium import webdriver from scrapy.http.response.html import HtmlResp ...
Scrapy 框架 CrawlSpider 全站数据爬取
CrawlSpider 全站数据爬取创建 crawlSpider 爬虫文件 scrapy genspider -t crawl chouti www.xxx.com import scrapy fr ...
scrapy框架之CrawlSpider全站自动爬取
全站数据爬取的方式 1.通过递归的方式进行深度和广度爬取全站数据,可参考相关博文(全站图片爬取),手动借助scrapy.Request模块发起请求. 2.对于一定规则网站的全站数据爬取,可以使用Cra ...
scrapy进阶（CrawlSpider爬虫__爬取整站小说）
# -*- coding: utf-8 -*- import scrapy,re from scrapy.linkextractors import LinkExtractor from scrapy ...
python爬虫之爬取糗事百科并将爬取内容保存至Excel中
本篇博文为使用python爬虫爬取糗事百科content并将爬取内容存入excel中保存·. 实验环境:Windows10 代码编辑工具:pycharm 使用selenium(自动化测试工具)+p ...
python爬虫爬取内容中，-xa0，-u3000的含义
python爬虫爬取内容中,-xa0,-u3000的含义 - CSDN博客 https://blog.csdn.net/aiwuzhi12/article/details/54866310
Crawlspider的自动爬取
引子 : 如果想要爬取糗事百科的全栈数据的方法 ? 方法一 : 基于scrapy框架中的scrapy的递归爬取进行实现(requests模块递归回调parse方法) . 方法二 : 基于Crawl ...
[Python爬虫] 使用 Beautiful Soup 4 快速爬取所需的网页信息
[Python爬虫] 使用 Beautiful Soup 4 快速爬取所需的网页信息 2018-07-21 23:53:02 larger5 阅读数 4123更多分类专栏: 网络爬虫版权声明: ...

随机推荐

mongodb - collMod
该方法给集合添加一个标识,来修改集合的行为. 标识包含usePowerOf2Sizes和index. 命令格式为: db.runCommand({"collMod":<col ...
怎样优化UITableView的性能
在iOS App中,UITableView应该是使用率最高的.同一时候也是最为复杂的视图. 差点儿全部自带的应用中都能看到它的身影,可见它的重要性. 在使用UITableView时,会常常遇到性能上的 ...
【转载】使用rman进行坏块修复（ORA-01578、ORA-01110）
[转自]http://blog.itpub.net/21256317/viewspace-1062055/ 使用rman进行坏块修复(ORA-01578.ORA-01110) 2012年的一天,处理的 ...
查看selinux的状态
sh-4.1# getenforce Disabled sh-4.1# getenforce Disabled 永久方法 – 需要重启服务器修改/etc/selinux/config文件中设置SEL ...
redis源码学习_字典
redis中字典有以下要点: (1)它就是一个键值对,对于hash冲突的处理采用了头插法的链式存储来解决. (2)对rehash,扩展就是取第一个大于等于used * 2的2 ^ n的数作为新的has ...
简单讲一下 SpringMVC的执行流程?
执行流程: 1. 用户向服务器发送请求,请求被 Spring 前端控制 Servelt DispatcherServlet 捕获(捕获) . DispatcherServlet对请求 URL进行解析 ...
linux学习笔记27--监控命令ps和top,free
Linux中的ps命令是Process Status的缩写.ps命令用来列出系统中当前运行的那些进程.ps命令列出的是当前那些进程的快照,就是执行ps命令的那个时刻的那些进程,如果想要动态的显示进程信 ...
结构体sockadrr、sockaddr_in、in_addr的定义
/* Internet address. */typedef uint32_t in_addr_t;struct in_addr { in_addr_t s_addr; }; typed ...
mongodb数据库安装与卸载
此处以centos下monggodb3.4版本安装为例,可参考官网安装教程步骤如下: 1.配置mongodb ym源 vi /etc/yum.repos.d/mongodb-org-3.4.repo ...
Error occurred whiLe getting the data source contents for the report
Web service request GetDataSourceContents to Report Server http://crm-vm/reportserver/ReportService2 ...

python框架Scrapy中crawlSpider的使用——爬取内容写进MySQL

python框架Scrapy中crawlSpider的使用——爬取内容写进MySQL的更多相关文章

随机推荐

热门专题