scrapy 博客爬取

item.py

import scrapy

class FulongpjtItem(scrapy.Item):

    # define the fields for your item here like:

    name = scrapy.Field()

    url = scrapy.Field()

    hits = scrapy.Field()

    comment = scrapy.Field()

pipeline.py

import pymysql

from pymysql import connections

class FulongpjtPipeline(object):

    def __init__(self):

        self.conn = pymysql.connect(host='127.0.0.1', user='root', passwd='', db='mydb')

        self.cursor = self.conn.cursor()

    def process_item(self, item, spider):

        for j in range(0,len(item['name'])):

            name = item['name'][j]

            url = item['url'][j]

            hits = item['hits'][j]

            comment = item['comment'][j]

            sql = "insert into boke(name,url,hits,comment) VALUES(%s,%s,%s,%s)"

            self.cursor.execute(sql,(name,url,hits,comment,))

            self.conn.commit()

        return item

    def close_spider(self,spider):

        self.conn.close()

spd.py

import scrapy

from Fulongpjt.items import FulongpjtItem

from scrapy.http import Request

import re

import urllib.request

class MyspdSpider(scrapy.Spider):

    name = "myspd"

    allowed_domains = ["hexun.com"]

    start_urls = ['http://hexun.com/']

    uid = ''

    def start_requests(self):

        yield Request('http://'+str(self.uid)+'.blog.hexun.com/p1/default.html',headers={'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36 QIHU 360EE'})

    def parse(self, response):

        item = FulongpjtItem()

        item['name'] = response.xpath('//span[@class="ArticleTitleText"]/a/text()').extract()

        item['url'] = response.xpath('//span[@class="ArticleTitleText"]/a/@href').extract()

        part1 = '''<script type="text/javascript" src="(http://click.tool.hexun.com/.*?)">'''

        hcurl = re.compile(part1).findall(str(response.body))[0]

        headers2 = ('User-Agent','Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36 QIHU 360EE')

        opener =urllib.request.build_opener()

        opener.addheaders =[headers2]

        urllib.request.install_opener(opener)

        data = urllib.request.urlopen(hcurl).read()

        part2 = "click\d*?','(\d*?)'"

        part3 = "comment\d*?','(\d*?)'"

        item['hits'] = re.compile(part2).findall(str(data))

        item['comment'] = re.compile(part3).findall(str(data))

        yield item

        # 提取文章总页数

        part4 = 'blog.hexun.com/p(.*?)/'

        data2=re.compile(part4).findall(str(response.body))

        if len(data2)>2:

            totalurl = data2[-2]

        else:

            totalurl = 1

        for i in range(2,int(totalurl)+1):

            next_url = 'http://'+str(self.uid)+'.blog.hexun.com/p'+str(i)+'/default.html'

            yield Request(next_url,callback=self.parse,headers={'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36 QIHU 360EE'})

scrapy 博客爬取的更多相关文章

cnblogs 博客爬取 + scrapy + 持久化 + 分布式
目录普通 scrapy 分布式爬取 cnblogs_spider.py 普通 scrapy # -*- coding: utf-8 -*- import scrapy from ..items im ...
安居客scrapy房产信息爬取到数据可视化(下)-可视化代码
接上篇:安居客scrapy房产信息爬取到数据可视化(下)-可视化代码,可视化的实现~ 先看看保存的数据吧~ 本人之前都是习惯把爬到的数据保存到本地json文件, 这次保存到数据库后发现使用mongod ...
爬虫系列5：scrapy动态页面爬取的另一种思路
前面有篇文章给出了爬取动态页面的一种思路,即应用Selenium+Firefox(参考<scrapy动态页面爬取>).但是selenium需要运行本地浏览器,比较耗时,不太适合大规模网页抓 ...
安居客scrapy房产信息爬取到数据可视化(上)-scrapy爬虫
出发点想做一个地图热力图,发现安居客房产数据有我要的特性.emmm,那就尝试一次好了~ 老规矩,从爬虫,从拿到数据开始... scrapy的配置创建一个项目(在命令行下敲~): scrapy st ...
scrapy模拟浏览器爬取验证码页面
使用selenium模块爬取验证码页面,selenium模块需要另外安装这里不讲环境的配置,我有一篇博客有专门讲ubuntn下安装和配置模拟浏览器的开发 spider的代码 # -*- coding: ...
手把手教大家如何用scrapy爬虫框架爬取王者荣耀官网英雄资料
之前被两个关系很好的朋友拉入了王者荣耀的大坑,奈何技术太差,就想着做一个英雄的随查手册,这样就可以边打边查了.菜归菜,至少得说明咱打王者的态度是没得说的,对吧?大神不喜勿喷!!!感谢!!废话不多说,开 ...
scrapy实验1 爬取中国人寿官网新闻，保存为xml
一.scrapy 实验爬中国人寿新闻,保存为xml 如需转发,请注明出处:小婷儿的python https://www.cnblogs.com/xxtalhr/p/10517297.html 链 ...
Scrapy爬虫实战-爬取体彩排列5历史数据
网站地址:http://www.17500.cn/p5/all.php 1.新建爬虫项目 scrapy startproject pfive 2.在spiders目录下新建爬虫 scrapy gens ...
Scrapy定时执行爬取任务与定时关闭任务
当我们利用Python scrapy框架写完脚本后,脚本已经可以稳定的进行数据的爬取,但是每次需要手动的执行,太麻烦,如果能自动运行,在自动关闭那就好了,经过小编研究,完全是可以实现的,今天小编介绍2 ...

随机推荐

[BZOJ1385] [Baltic2000] Division expression (数学)
Description 除法表达式有如下的形式: X1/X2/X3.../Xk 其中Xi是正整数且Xi<=1000000000(1<=i<=k,K<=10000) 除法表达式应 ...
如何使用mysqldump备份数据库
一.背景在开发项目中,数据库是核心资产.除了做主备冗余增加可靠性外,定期备份数据也是必须的. 使用mysqldump备份数据具有操作简单,备份和恢复时间短的优点(mysqldump备份数据生成的是批 ...
使用Dreamweaver正则表达式替换href中的内容
在Dreamweaver中使用正则表达式替换href中的内容,就像下面这些href中的内容复杂多样的情况下,href="/html/u.html",href="/tuho ...
ubuntu上修改root密码
ubuntu上修改root密码 author: headsen chen 2017-10-12 10:49:28 个人原创,转载请注明作者,出处. sudo passwd 两次输入想设置的r ...
firemonkey ListView DynamicAppearance
Go Up to FireMonkey Application Design Contents [hide] 1 Customizing the List View Appearance Prope ...
基于 CDH 构建推荐系统
我理解的推荐系统本质是一种排序方式.排序的规则是按照我们预测的用户喜好程度的一个排序的列表,而如何定义用户的喜好程度是推荐系统要解决的核心问题.机器学习的算法只是推荐系统的一部分.构建一个完整的推荐系 ...
数据模型LP32 ILP32 LP64 LLP64 ILP64
各个C++实现所选择采用的基础类型的大小统称为"数据模型".有四种广泛采用的数据模型: 32 位系统: LP32 或 2/4/4(int 为 16-bit,long 和指针为 32 ...
shiro(二)自定义realm，模拟数据库查询验证
自定义一个realm类,实现realm接口 package com; import org.apache.shiro.authc.*; import org.apache.shiro.realm.Re ...
排序算法Java实现（归并排序）
算法描述:对于给定的一组记录,首先将每两个相邻的长度为1的子序列进行归并,得到 n/2(向上取整)个长度为2或1的有序子序列,再将其两两归并,反复执行此过程,直到得到一个有序序列. package s ...
【Bootstrap】 bootstrap-table表格组件
[Bootstrap-table] 顾名思义,这个组件专注于bootstrap风格的表格的设计,并且提供了很多表格的基础和进阶的功能,给我们开发前端的表格省下很多力气. 本文主要参考这位博主的系列文章 ...

scrapy 博客爬取

scrapy 博客爬取的更多相关文章

随机推荐

热门专题