爬取知名社区技术文章_article

爬虫主逻辑处理，获取字段，获取主url和子url

#!/usr/bin/python3

# -*- coding: utf-8 -*-

import scrapy

from scrapy.http import Request

from urllib import parse

from JobBole.items import JobboleItem, ArticleItemLoader

class ExampleSpider(scrapy.Spider):

    name = 'jobbole'

    # allowed_domains = ['example.com']

    # 起始url

    start_urls = ['http://blog.jobbole.com/all-posts/']

    def parse(self, response):

        # 获取主页面所以有效详情页面url，图片url，下一页url

        home_all_node = response.css('.post.floated-thumb .post-thumb a')

        # 获取节点，循环出每个单张图片和单个url交个下载器和子url处理

        for home_node in home_all_node:

            img_url = home_node.css('img::attr(src)').extract_first('')

            cont_url = home_node.css('::attr(href)').extract_first('')

            # yield 提供异步方法，parser 进行域名拼接，meta进行传值

            yield Request(url=parse.urljoin(response.url, cont_url),

                          meta={'img_url': img_url},

                          callback=self.analysie_go)

        # 提取下一页并下载

        next_page_url = response.css('.next.page-numbers::attr(href)').extract_first('')

        if next_page_url:

            yield Request(url=parse.urljoin(response.url, next_page_url), callback=self.parse)

    def analysie_go(self, response):

        # 解析详情页面获取所需其他字段的值

        img_url = response.meta.get('img_url', '0')

        load_item = ArticleItemLoader(item=JobboleItem(), response=response)

        load_item.add_value('img_url', img_url)

        load_item.add_value('cont_url', response.url)

        load_item.add_value('cont_id', response.url)

        load_item.add_css('title', '.entry-header h1::text')

        load_item.add_css('publish_time', '.entry-meta-hide-on-mobile::text')

        load_item.add_xpath('cont', '//div[@class="entry"]//text()')

        load_item.add_css('link_num', '.vote-post-up h10::text')

        load_item.add_css('collection_num', '.bookmark-btn::text')

        load_item.add_css('comment_num', '.post-adds a span::text')

        article_items = load_item.load_item()

        # 把获取的字段交给items

        yield article_items

爬取知名社区技术文章_article_3的更多相关文章

爬取知名社区技术文章_items_2
item中定义获取的字段和原始数据进行处理并合法化数据 #!/usr/bin/python3 # -*- coding: utf-8 -*- import scrapy import hashlib ...
爬取知名社区技术文章_setting_5
# -*- coding: utf-8 -*- # Scrapy settings for JobBole project # # For simplicity, this file contains ...
爬取知名社区技术文章_pipelines_4
获取字段的存储处理和获取普通的路径 #!/usr/bin/python3 # -*- coding: utf-8 -*- import pymysql import gevent import pym ...
第4章 scrapy爬取知名技术文章网站(2)
4-8~9 编写spider爬取jobbole的所有文章 # -*- coding: utf-8 -*- import re import scrapy import datetime from sc ...
爬取博主所有文章并保存到本地（.txt版）--python3.6
闲话: 一位前辈告诉我大学期间要好好维护自己的博客,在博客园发布很好,但是自己最好也保留一个备份. 正好最近在学习python,刚刚从py2转到py3,还有点不是很习惯,正想着多练习,于是萌生了这个想 ...
爬虫实战——Scrapy爬取伯乐在线所有文章
Scrapy简单介绍及爬取伯乐在线所有文章一.简说安装相关环境及依赖包 1.安装Python(2或3都行,我这里用的是3) 2.虚拟环境搭建: 依赖包:virtualenv,virtualenvwr ...
Node爬取简书首页文章
Node爬取简书首页文章博主刚学node,打算写个爬虫练练手,这次的爬虫目标是简书的首页文章流程分析使用superagent发送http请求到服务端,获取HTML文本用cheerio解析获得的 ...
使用Python爬取微信公众号文章并保存为PDF文件(解决图片不显示的问题)
前言第一次写博客,主要内容是爬取微信公众号的文章,将文章以PDF格式保存在本地. 爬取微信公众号文章(使用wechatsogou) 1.安装 pip install wechatsogou --up ...
Python3.6+Scrapy爬取知名技术文章网站
爬取分析伯乐在线已经提供了所有文章的接口,还有下一页的接口,所有我们可以直接爬取一页,再翻页爬. 环境搭建 Windows下安装Python: http://www.cnblogs.com/0bug ...

随机推荐

SpringCloud学习笔记(7)——Sleuth
Part VII. Spring Cloud Sleuth 46. Introduction Spring Cloud Sleuth为Spring Cloud实现了分布式的跟踪解决方案 46.1 Te ...
【可持久化线段树】POJ2104 查询区间第k小值
K-th Number Time Limit: 20000MS Memory Limit: 65536K Total Submissions: 61284 Accepted: 21504 Ca ...
ADO对SQL Server 2008数据库的基础操作
最近在学习ADO与数据库的相关知识,现在我将自己学到的东西整理写出来,也算是对学习的一种复习. 这篇文章主要说明如何遍历某台机器上所有的数据库服务,遍历某个服务中所有的数据库,遍历数据库中的所有表以及 ...
BaseServer的介绍
服务器类型 5种类型:BaseServer,TCPServer,UnixStreamServer,UDPServer,UnixDatagramServer.注意:BaseServer不直接对外服务. ...
LevelDB的源码阅读（二） Open操作
在Linux上leveldb的安装和使用中我们写了一个测试代码,内容如下: #include "leveldb/db.h" #include <cassert> #in ...
mongodb 的基本函数语法封装
//这个模块里面封装了所有对数据库的常用操作 var MongoClient = require('mongodb').MongoClient; var config = require(" ...
java调用c++函数的简单笔记
java使用jni调用c++动态库函数. 步骤: 1．编写java测试代码如下: public class CallNativeDemo { native void func(); native do ...
MyBatis之基于XML的属性与列名映射
上一博客主要是对单表的增删改查,比较简单,而且每个属性与table表的列都是一一对应名字也一样,今天主要学习属性与table表列名不一致的处理,主要有两种一是属性与列名不一致,二是枚举的情况,这里暂时 ...
Redis4.0 Cluster — Centos7
本文版权归博客园和作者吴双本人共同所有转载和爬虫请注明原文地址 www.cnblogs.com/tdws 一.基础安装 wget http://download.redis.io/releases/ ...
Codeforces 833D Red-black Cobweb【树分治】
D. Red-black Cobweb time limit per test:6 seconds memory limit per test:256 megabytes input:standard ...

爬取知名社区技术文章_article_3

爬取知名社区技术文章_article_3的更多相关文章

随机推荐

热门专题