scrapy爬取网址，进而爬取详情页问题

1、最容易出现的问题是爬取到的url大多为相对路径，如果直接将爬取到的url进行二次爬取就会出现以下报错：

　　raise ValueError('Missing scheme in request url: %s' % self._url)，该错误的意思是request的url为无效链接。

解决方法：将相对路径转换为绝对路径

 # -*- coding: utf-8 -*-

 import scrapy

 from pyquery import PyQuery

 from ..items import City10Item

 from scrapy.http import Request

 from scrapy.utils.response import get_base_url

 from urllib.parse import urljoin

 class CitySpiderTest1Spider(scrapy.Spider):

     name = 'city_spider_test1'

     allowed_domains = ['58.com']

     start_urls = ['https://cq.58.com/chuzu/']

     def parse(self, response):

         jpy=PyQuery(response.text)

         li=jpy('body > div.mainbox > div > div.content > div.listBox > ul > li').items()

         for i in li:

             item=City10Item()

             item['name']=i('div.des > h2 > a').text()

             item['url']=i('div.des > h2 > a').attr('href') #爬取url，此时为相对路径

             item['price']=i('div.listliright > div.money > b').text()

             base_url = get_base_url(response) #获取相对路径前级地址

             abs_url=urljoin(base_url,item['url']) #转换为绝对路径

             if item['url']:

                 yield Request(abs_url,

                               callback=self.detail_parse, #回调详情页函数

                               meta={'item':item}, #将参数传递给meta

                               priority=10,

                               dont_filter=True #强制不过滤

                 )

     def detail_parse(self,response):

         jpy = PyQuery(response.text)

         item = response.meta['item']   #接收item

         item['introduce_item'] = jpy('body > div.main-wrap > div.house-detail-desc > div.main-detail-info.fl > div.house-word-introduce.f16.c_555 > ul > li:nth-child(1) > span.a2').text()   #提取房屋亮点

         item['address'] = jpy('body > div.main-wrap > div.house-basic-info > div.house-basic-right.fr > div.house-basic-desc > div.house-desc-item.fl.c_333 > ul > li:nth-child(6) > span.dz').text()   #房屋详情地址

         item['phone_number'] = jpy('body > div.main-wrap > div.house-basic-info > div.house-basic-right.fr > div.house-fraud-tip > div.house-chat-phone > span').text()   #电话号码

         yield item

scrapy爬取网址，进而爬取详情页问题的更多相关文章

【图文详解】scrapy爬虫与动态页面——爬取拉勾网职位信息（2）
上次挖了一个坑,今天终于填上了,还记得之前我们做的拉勾爬虫吗?那时我们实现了一页的爬取,今天让我们再接再厉,实现多页爬取,顺便实现职位和公司的关键词搜索功能. 之前的内容就不再介绍了,不熟悉的请一定要 ...
(3)分布式下的爬虫Scrapy应该如何做-递归爬取方式，数据输出方式以及数据库链接
放假这段时间好好的思考了一下关于Scrapy的一些常用操作,主要解决了三个问题: 1.如何连续爬取 2.数据输出方式 3.数据库链接一,如何连续爬取: 思考:要达到连续爬取,逻辑上无非从以下的方向着 ...
Scrapy 通过登录的方式爬取豆瓣影评数据
Scrapy 通过登录的方式爬取豆瓣影评数据爬虫 Scrapy 豆瓣 Fly 由于需要爬取影评数据在来做分析,就选择了豆瓣影评来抓取数据,工具使用的是Scrapy工具来实现.scrapy工具使用起来 ...
七月在线爬虫班学习笔记（五）——scrapy spider的几种爬取方式
第五课主要内容有: Scrapy框架结构,组件及工作方式单页爬取-julyedu.com 拼URL爬取-博客园循环下页方式爬取-toscrape.com Scrapy项目相关命令-QQ新闻 1.S ...
python3 requests + BeautifulSoup 爬取阳光网投诉贴详情实例代码
用到了requests.BeautifulSoup.urllib等,具体代码如下. # -*- coding: utf-8 -*- """ Created on Sat ...
多线程爬虫爬取详情页HTML
注意:如果想爬取详情页的信息请按须添加方法 import requests import os import re import threading from lxml import etree #爬 ...
scrapy之盗墓笔记三级页面爬取
#今日目标 **scrapy之盗墓笔记三级页面爬取** 今天要爬取的是盗墓笔记小说,由分析该小说的主要内容在三级页面里,故需要我们一一解析 *代码实现* daomu.py ``` import sc ...
scrapy中使用selenium来爬取页面
scrapy中使用selenium来爬取页面 from selenium import webdriver from scrapy.http.response.html import HtmlResp ...
Python爬虫：新浪新闻详情页的数据抓取（函数版）
上一篇文章<Python爬虫:抓取新浪新闻数据>详细解说了如何抓取新浪新闻详情页的相关数据,但代码的构建不利于后续扩展,每次抓取新的详情页时都需要重新写一遍,因此,我们需要将其整理成函数, ...

随机推荐

springboot 取消post数据大小限制
参考 https://blog.csdn.net/kkgbn/article/details/52088068 application.properties 添加 server.tomcat.max- ...
js前端导出excel：json形式的导出
第一中形式的导出:主要是表头对应主体数据,json形式的导出 js库文件名称 : table2excel.js这个js库文件是网上找的,并且自己根据自己业务需求把内容改了一下复制到 table2exc ...
glove
glove - 必应词典美[ɡlʌv]英[ɡlʌv] v.给戴手套:作…的手套 n.(分手指的)手套网络分指手套:拳套:棒球之爱变形复数:gloves:现在分词:gloving:过去分词:glo ...
RxJS之工具操作符 ( Angular环境 )
一 delay操作符源Observable延迟指定时间,再开始发射值. import { Component, OnInit } from '@angular/core'; import { of ...
服务器使用VMware系软件管理主机集群
在服务器安装ESXI 6.0系统,此系统300多M,用于管理服务器上的主机. 其他主机安装个vsphere client连接后可ESXI系统可进行简单管理如果要更强大的功能,需要安装vcenter ...
【laravel VS lumen】
读取项目的配置信息读取config文件database.php中的default属性信息 laravel:config('database.default'); lumen:app()->co ...
小白鼠排队（map容器插入数据的四种方法）
题目描述 N只小白鼠(1 <= N <= 100),每只鼠头上戴着一顶有颜色的帽子.现在称出每只白鼠的重量,要求按照白鼠重量从大到小的顺序输出它们头上帽子的颜色.帽子的颜色用“red”,“ ...
linux命令学习之：cp
cp命令用来复制文件或者目录,是Linux系统中最常用的命令之一. 如同时指定两个以上的文件或目录,且最后的目的地是一个已经存在的目录,则它会把前面指定的所有文件或目录复制到此目录中.若同时指定多个文 ...
Exception starting filter encodingFilter
1. maven运行tomcat6出现错误Exception starting filter encodingFilter: 严重: Exception starting filter encodin ...
go语言net包rpc远程调用的使用
一.基于http的RPC 服务端: package main; import ( "net/rpc" "net/http" "log" ) ...

scrapy爬取网址，进而爬取详情页问题

scrapy爬取网址，进而爬取详情页问题的更多相关文章

随机推荐

热门专题