Pyspider上手

pyspider安装： pip3 install Pyspider

启动服务操作

1、打开cmd:输入 pyspider --help 回车，可以查看帮助信息，pyspider all 启动command服务

2、启动后看到0.0.0.0.5000 提示就启动好了，打开浏览器127.0.0.1：5000或者http://localhost:5000/ 打开pyspider的web UI界面，

3、首先点击creat创建项目，名字任意

4、右边web页面代码如下：

#!/usr/bin/env python

# -*- encoding: utf-8 -*-
# Created on 2018-08-22 23:16:23
# Project: TripAdvisor

from pyspider.libs.base_handler import *

class Handler(BaseHandler):
crawl_config = {
}

@every(minutes=24 * 60)
def on_start(self):
self.crawl('__START_URL__', callback=self.index_page)

@config(age=10 * 24 * 60 * 60)
def index_page(self, response):
for each in response.doc('a[href^="http"]').items():
self.crawl(each.attr.href, callback=self.detail_page)

@config(priority=2)
def detail_page(self, response):
return {
"url": response.url,
"title": response.doc('title').text(),
}

把__START_URL__替换成要爬取的网站地址，进行save，点击左边的run按钮，点击左边窗体的follow点击《、》箭头

第一次尝试pyspider，出师未捷身先死，，，599了，立马百度下PySpider HTTP 599: SSL certificate problem错误的解决方法，发现有同病相怜的小伙伴，学习下经验https://blog.csdn.net/asmcvc/article/details/51016485

报错完整的代码（每个人安装的python路径不一样地址会有差异）

[E 180822 23:51:45 base_handler:203] HTTP 599: SSL certificate problem: self signed certificate in certificate chain

    Traceback (most recent call last):

      File "e:\programs\python\python36\lib\site-packages\pyspider\libs\base_handler.py", line 196, in run_task

        result = self._run_task(task, response)

      File "e:\programs\python\python36\lib\site-packages\pyspider\libs\base_handler.py", line 175, in _run_task

        response.raise_for_status()

      File "e:\programs\python\python36\lib\site-packages\pyspider\libs\response.py", line 172, in raise_for_status

        six.reraise(Exception, Exception(self.error), Traceback.from_string(self.traceback).as_traceback())

      File "e:\programs\python\python36\lib\site-packages\six.py", line 692, in reraise

        raise value.with_traceback(tb)

      File "e:\programs\python\python36\lib\site-packages\pyspider\fetcher\tornado_fetcher.py", line 378, in http_fetch

        response = yield gen.maybe_future(self.http_client.fetch(request))

      File "e:\programs\python\python36\lib\site-packages\tornado\httpclient.py", line 102, in fetch

        self._async_client.fetch, request, **kwargs))

      File "e:\programs\python\python36\lib\site-packages\tornado\ioloop.py", line 458, in run_sync

        return future_cell[0].result()

      File "e:\programs\python\python36\lib\site-packages\tornado\concurrent.py", line 238, in result

        raise_exc_info(self._exc_info)

      File "<string>", line 4, in raise_exc_info

    Exception: HTTP 599: SSL certificate problem: self signed certificate in certificate chain

错误原因：

这个错误会发生在请求 https 开头的网址，SSL 验证错误，证书有误。

解决方法：

使用 self.crawl(url, callback=self.index_page, validate_cert=False) ------------------------------validate_cert=False要放在每个提取页里面不然打开子页面还是会599，吐血

代码如下：

 #!/usr/bin/env python

 # -*- encoding: utf-8 -*-

 # Created on 2018-08-23 23:06:13

 # Project: v2ex

 from pyspider.libs.base_handler import *

 class Handler(BaseHandler):

     crawl_config = {

     }

     @every(minutes=24 * 60)

     def on_start(self):

         self.crawl('https://www.v2ex.com/?tab=tech', callback=self.index_page,validate_cert=False)

     @config(age=10 * 24 * 60 * 60)

     def index_page(self, response):

         for each in response.doc('a[href^="https://www.v2ex.com/?tab="]').items():

             self.crawl(each.attr.href, callback=self.tab_page, validate_cert=False)

     @config(priority=2)

     def tab_page(self, response):

         for each in response.doc('a[href^="https://www.v2ex.com/go/"]').items():

             self.crawl(each.attr.href, callback=self.board_page, validate_cert=False)

     @config(priority=2)

     def board_page(self, response):

         for each in response.doc('a[href^="https://www.v2ex.com/t/"]').items():

             url = each.attr.href

             if url.find('#reply') > 0:

                 url = url[0:url.find('#')]

             self.crawl(url, callback=self.detail_page, validate_cert=False)        

     @config(priority=2)

     def detail_page(self, response):

         title = response.doc('h1').text()

         content = response.doc('div.topic_content')

         return {

             "url": response.url,

             "title": response.doc('title').text(),

         }

这个方法基本可以解决问题了（浏览器要手动刷新下，用360安全浏览器貌似有这个小问题，可能是我设置的问题，果断换chrome和火狐试了下，没发现这个情况。。。）

For Linux and MAC systems, please refer to the following links：

https://blog.csdn.net/WebStudy8/article/details/51610953

Pyspider上手的更多相关文章

芝麻软件： Python爬虫进阶之爬虫框架概述
综述爬虫入门之后,我们有两条路可以走. 一个是继续深入学习,以及关于设计模式的一些知识,强化Python相关知识,自己动手造轮子,继续为自己的爬虫增加分布式,多线程等功能扩展.另一条路便是学习一些优 ...
Python爬虫进阶一之爬虫框架概述
综述爬虫入门之后,我们有两条路可以走. 一个是继续深入学习,以及关于设计模式的一些知识,强化Python相关知识,自己动手造轮子,继续为自己的爬虫增加分布式,多线程等功能扩展.另一条路便是学习一些优 ...
python爬虫框架（1）--框架概述
框架概述其中比较好用的是 Scrapy 和PySpider.pyspider上手更简单,操作更加简便,因为它增加了 WEB 界面,写爬虫迅速,集成了phantomjs,可以用来抓取js渲染的页面.S ...
python爬虫框架Pyspider初次接触
pyspider网站地址:http://docs.pyspider.org/en/latest/.文档比较好,安装起来也非常方便.既然是基于python的框架,那么首先得安装python.微软出的一款 ...
【Python五篇慢慢弹】快速上手学python
快速上手学python 作者:白宁超 2016年10月4日19:59:39 摘要:python语言俨然不算新技术,七八年前甚至更早已有很多人研习,只是没有现在流行罢了.之所以当下如此盛行,我想肯定是多 ...
Impress.js上手 - 抛开PPT、制作Web 3D幻灯片放映
前言: 如果你已经厌倦了使用PPT设置路径.设置时间.设置动画方式来制作动画特效.那么Impress.js将是你一个非常好的选择. 用它制作的PPT将更加直观.效果也是嗷嗷美观的. 当然,如果用它来装 ...
ECharts数据图表系统？ 5分钟上手！
目录: 前言简介方法一:模块化单文件引入(推荐) 方法二:标签式单文件引入 [前言] 最近在捣鼓各种插件各种框架,发现这个ECharts还是比较不错的,文档也挺全的,还是中文的,给大家推荐一下. ...
快速上手Unity原生Json库
现在新版的Unity(印象中是从5.3开始)已经提供了原生的Json库,以前一直使用LitJson,研究了一下Unity用的JsonUtility工具类的使用,发现使用还挺方便的,所以打算把项目中的J ...
Masonry介绍与使用实践：快速上手Autolayout
1 MagicNumber -> autoresizingMask -> autolayout 以上是纯手写代码所经历的关于页面布局的三个时期在iphone1-iphone3gs时代 w ...

随机推荐

Mysql 数据类型以及约束
数据类型整型默认有符号无符号(unsigned) 和有符号用 0 填充 zerofill 约束的作用: 保证数据的完整性和一致性 tinyint[ -128 , 127 ] 小整数无符号( ...
springboot中使用freemarker生成word文档并打包成zip下载（简历）
一.设计出的简历模板图以及给的简历小图标切图二.按照简历模板图新建简历word文件 :${字段名},同时将图片插入到word中,并将建好的word文件另存为xml文件: 三.直 ...
binarySearch(int[] a,int fromIndex,int toIndex, int key)的用法
package com.Summer_0420.cn; import java.util.Arrays; /** * @author Summer * binarySearch(int[] a,int ...
NameValueCollection类读取配置信息
C#中的NameValueCollection类读取配置信息,大家可以参考下. 我首先介绍配置文件中的写法: 1.在VS2015中的工程下建立一个控制台应用程序,其config文件默认名称为App ...
StackExchange.Redis使用配置
转自:http://www.cnblogs.com/deosky/p/4848403.html Configurationredis有很多不同的方法来配置连接字符串 , StackExchange.R ...
python：面向对象编程之Zope.interface安装使用
持续学习python+django中... 一.接口简述在我们所熟知的面向对象编程语言中,大多提供了接口(interface)的概念.接口在编程语言中指的是一个抽象类型,是抽象方法的集合:它的特点如 ...
day91-redis
Redis数据库简介 redis是一个key-value存储系统.和Memcached类似,它支持存储的value类型相对更多,包括string(字符串).list(链表).set(集合).zset ...
唯一正确的修改Jupyter Notebook默认路径的方法
唯一正确修改Jupyter Notebook的默认路径 1.按照网上的方法,先修改了快捷方式的起始位置,发现并不能修改默认路径. 2.后来发现“目标”中后面有个参数%USERPROFILE%,它代表的 ...
Ambari 使用 Hive View 异常处理
异常:进入Hive View提示user home check fail 详细日志:Service 'userhome' check failed: java.io.FileNotFoundExcep ...
AbstractQueuedSynchronizer
1 简介 AbstractQueuedSynchronizer简称AQS是一个抽象同步框架,可以用来实现一个依赖状态的同步器.JDK1.5中提供的java.util.concurrent包中的大多数的 ...

Pyspider上手

Pyspider上手的更多相关文章

随机推荐

热门专题