1.参考

pyspider作者官网：

其他：

2.jQuery 语法

jQuery 是一个 JavaScript 库。jQuery 极大地简化了 JavaScript 编程。
http://www.w3school.com.cn/jquery/jquery_syntax.asp
http://www.w3school.com.cn/jquery/jquery_selectors.asp
http://www.w3school.com.cn/jquery/jquery_ref_selectors.asp

语法    描述
$(this)    当前 HTML 元素
$("p")    所有 <p> 元素
$("p.intro")    所有 class="intro" 的 <p> 元素
$(".intro")    所有 class="intro" 的元素
$("#intro")    id="intro" 的元素
$("ul li:first")    每个 <ul> 的第一个 <li> 元素
$("[href]") 选取所有带有 href 属性的元素。
$("[href='#']") 选取所有带有 href 值等于 "#" 的元素。
$("div#intro .head")    id="intro" 的 <div> 元素中的所有 class="head" 的元素

jQuery CSS 选择器可用于改变 HTML 元素的 CSS 属性。!!!!!
$("p").css("background-color","red");

3.pyspider相关

(1) 全局配置，调试时每次修改代码记得更新itag，save，刷新页面再run

class Handler(BaseHandler):

    crawl_config = {

        'itag': 'v001',

        'headers': {'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:54.0) Gecko/20100101 Firefox/54.0'}

    }

(2) response.save用于传递数据

    file_name = 'xxx'

    self.crawl(img.attr.src, callback=self.save_img, save={'file_name': file_name})

def save_img(self,response):

    file_name = response.save['file_name']  #使用传入的数据

(3) 如果返回结果为多项的json，无法每一项返回一个条目。。。

# https://binux.blog/2015/01/pyspider-tutorial-level-2-ajax-and-more-http/

# 我测试返回的数据不是预期（我想每个电影为显示一行）

# 你想要在界面中显示为多行？这是不行的，results 页面永远只会每个 url 返回一个结果。如果这个结果是一个数组，那么就显示一个数组。

    def json_parser(self, response):

        return [{

            "title": x['title'],

            "rate": x['rate'],

            "url": x['url']

        } for x in response.json['subjects']]

(4) 操作pyspider的response.doc

xml_doc = '''

<?xml version="1.0" encoding="ISO-8859-1"?>

<bookstore>

    <book>

      <title lang="eng">Harry Potter</title>

      <price>29.99</price>

    </book>

    <book>

      <title lang="eng">Learning XML</title>

      <price>39.95</price>

    </book>

</bookstore>'''

from pyquery import PyQuery

response_doc = PyQuery(xml_doc)  #response_doc即pyspider的response.doc

for each in response_doc('book>title').items():   #括号内部使用CSS选择tag，.items()用来遍历

    print each.attr.lang

    print each.text()

    print 123

(5) 操作pyspider的response.etree

html_doc = '''

<div>

    <ul>

         <li class="item-0">first item</li>

         <li class="item-1"><a href="link2.html">second item</a></li>

         <li class="item-0 active"><a href="link3.html"><span class="bold">third item</span></a></li>

         <li class="item-1 active"><a href="link4.html">fourth item</a></li>

         <li class="item-0"><a href="link5.html">fifth item</a></li>

     </ul>

 </div>'''

import lxml.html

response_etree = lxml.html.fromstring(html_doc)   #response_etree即pyspider的response.etree

for each in response_etree.xpath('//ul/li/a'):

    print each.xpath('./@href') #返回列表  [0]可能报错

    print each.text

    print 123

print

for each in response_etree.cssselect('div li a'):

    print each.get('href')  #推荐或返回None

    print each.text

    print 123

print

(6) 方便本地调试response.doc 和 response.etree

url = 'http://movie.douban.com/top250'

headers={'user-agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:54.0) Gecko/20100101 Firefox/54.0'}

# response_doc = PyQuery(url,headers=headers)

request = urllib2.Request(url,headers=headers)

f = urllib2.urlopen(request)

# Note: this returns a tree, not an element.  Use``parse(...).getroot()`` to get the document root.

response_etree = lxml.html.parse(f).getroot()    #.getroot() 

for each in response_etree.xpath('//a[contains(@href,"subject")]'):

    print each.xpath('./@href')[0]

print

for each in response_etree.cssselect('a[href*="subject"]'):

    print each.get('href')

print 

# pyspider源代码为doc=PyQuery(etree)

response_doc = PyQuery(response_etree)

for each in response_doc('a[href*="subject"]').items():

    print each.attr.href

pyspider和pyquery总结的更多相关文章

pyspider用PyQuery解析页面数据
示例说明: 本示例主要是PyQuery解析返回的response页面数据.response.doc解析页面数据是pyspider的主要用法,应该熟练掌握基本使用方法.其他返回类型示例见后续文章. py ...
【转】CentOS 6.5安装pyspider过程记录
原文地址:http://blog.sina.com.cn/s/blog_48c95a190102wczx.html 1.根据pyspider官方推荐的安装方法,使用pip命令直接安装pyspider ...
pyspider示例代码三：用PyQuery解析页面数据
本系列文章主要记录和讲解pyspider的示例代码,希望能抛砖引玉.pyspider示例代码官方网站是http://demo.pyspider.org/.上面的示例代码太多,无从下手.因此本人找出一些 ...
pyspider 简单应用之快速问医生药品抓取（一）
网址:http://yp.120ask.com/search/-0-0--0-0-0-0.html from pyspider.libs.base_handler import * class Han ...
python3.4+pyspider爬58同城（二）
之前使用python3.4+selenium实现了爬58同城的详细信息,这次用pyspider实现,网上搜了下,目前比较流行的爬虫框架就是pyspider和scrapy,但是scrapy不支持pyth ...
scrapy跟pyspider的杂谈
最近有一个私人项目要搞,可能最近的博客都会变成爬虫跟数据分析类的了.既然是爬虫,第一反应想到的就是鼎鼎大名的scrapy了,其次想到的pyspider,最后想到的就是自己写. scrapy是封装了tw ...
Python pyspider 安装与开发
PySpider 简介 PySpider是一个国人编写的强大的网络爬虫系统并带有强大的WebUI.采用Python语言编写,分布式架构,支持多种数据库后端,强大的WebUI支持脚本编辑器.任务监视器, ...
Python爬虫-pyspider框架的使用
pyspider 是一个用python实现的功能强大的网络爬虫系统,能在浏览器界面上进行脚本的编写,功能的调度和爬取结果的实时查看,后端使用常用的数据库进行爬取结果的存储,还能定时设置任务与任务优 ...
pyspider 文档介绍
一代码区结构 def on_start(self)是脚本的入口点.单击run仪表板上的按钮时将调用它. self.crawl(url, callback=self.index_page)*是这里最重 ...

随机推荐

[Linux] Vim 撤销回退操作
在vi中按u可以撤销一次操作 u 撤销上一步的操作 Ctrl+r 恢复上一步被撤销的操作注意: 如果你输入“u”两次,你的文本恢复原样,那应该是你的Vim被配置在Vi兼容 ...
CF5E Bindian Signalizing
题目这题目是真的很水,洛谷给他紫题也差不多算恶意评分了吧233 这种一眼切的题改了很长时间,不是什么n-1搞错,就是什么and打成or,所以写这篇博客给自己长个记性QWQ 题意:n座山组成一个环,相 ...
Mycat的读写分离
1. Mycat实现读写分离的部署: https://www.cnblogs.com/softidea/p/5447566.html springboot动态数据源的原理以及配置: Spring内置了 ...
[SDOI2006] 保安站岗
题目链接第一遍不知道为什么就爆零了…… 第二遍改了一下策略,思路没变,结果不知道为什么就 A 了??? 树形 DP 经典问题:选择最少点以覆盖树上所有点(边). 对于本题,设 dp[i][0/1][ ...
统计iis日志第一例的次数
统计iis日志第一例(日期)出现的次数 IIS日志文件格式: #Software: Microsoft Internet Information Services 7.5 #Version: 1.0 ...
第十节：基于MVC5+Unity+EF+Log4Net的基础结构搭建
一. 前言本节继续探讨一种新的框架搭建模式,框架的结构划分和上一节是相同的,本节IOC框架换成了Unity,并且采用构造函数注入的方式,另外服务层的封装模式也发生了变化,下面将详细的进行探讨. (一 ...
WEB内容换行
word-wrap:break-word 单词间换行 word-break:break-all 单词内也可以换行 white-space属性指定元素内的空白怎样处理 normal 默认.空白会被浏览器 ...
【JS】CharToAsciiToBinaryToAsciiToChar
<!DOCTYPE html> <html> <head> <script src="/jquery/jquery-1.11.1.min.js&qu ...
centos7安装notepadqq
这是在centos7 上发表的第一篇博文对linux系统陌生,折腾了一天,安装好了搜狗输入法.相关文章也不少,但照着一步一步来,都没有成功.最后照着这篇弄成了: ****** 安装notepadd+ ...
LCA学习笔记
写在前面目录一.LCA的定义二.暴力法求LCA 三.倍增法求LCA 四.树链剖分求LCA 五.LCA典型例题题目完成度一.LCA的定义 LCA指的是最近公共祖先.具体地,给定一棵有根树,若结 ...

pyspider和pyquery总结