scrapy基础知识之 scrapy 三种模拟登录策略：

注意：模拟登陆时，必须保证settings.py里的 `COOKIES_ENABLED` (Cookies中间件) 处于开启状态

COOKIES_ENABLED = True或 # COOKIES_ENABLED = False

策略一：直接POST数据（比如需要登陆的账户信息)

# -*- coding: utf-8 -*-

import scrapy

class Renren1Spider(scrapy.Spider):

    name = "renren1"

    allowed_domains = ["renren.com"]

    def start_requests(self):

        url = 'http://www.renren.com/PLogin.do'

        # FormRequest 是Scrapy发送POST请求的方法

        yield scrapy.FormRequest(

                url = url,

                formdata = {"email" : "xx", "password" : "xx"},

                callback = self.parse_page)

    def parse_page(self, response):

        with open("mao2.html", "wb") as filename:

            filename.write(response.body)

策略二：标准的模拟登陆步骤

1.首先发送登录页面的get请求，获取到页面里的登录必须的参数（比如说zhihu登陆界面的 _xsrf）

2.然后和账户密码一起post到服务器，登录成功

# -*- coding: utf-8 -*-

import scrapy

class Renren2Spider(scrapy.Spider):

    name = "renren2"

    allowed_domains = ["renren.com"]

    start_urls = (

        "http://www.renren.com/PLogin.do",

    )

 # 处理start_urls里的登录url的响应内容，提取登陆需要的参数（如果需要的话)

    def parse(self, response):

        # 提取登陆需要的参数

        #_xsrf = response.xpath("//_xsrf").extract()[0]

        # 发送请求参数，并调用指定回调函数处理

        yield scrapy.FormRequest.from_response(

                response,

                formdata = {"email" : "xxx", "password" : "xxxxxxx"},#, "_xsrf" = _xsrf},

                callback = self.parse_page

            )

 # 获取登录成功状态，访问需要登录后才能访问的页面

    def parse_page(self, response):

        url = "http://www.renren.com/422167102/profile"

        yield scrapy.Request(url, callback = self.parse_newpage)

    # 处理响应内容

    def parse_newpage(self, response):

        with open("xiao.html", "wb") as filename:

            filename.write(response.body)

策略三：直接使用保存登陆状态的Cookie模拟登陆

如果实在没办法了，可以用这种方法模拟登录，虽然麻烦一点，但是成功率100%

# -*- coding: utf-8 -*-

import scrapy

class RenrenSpider(scrapy.Spider):

    name = "renren"

    allowed_domains = ["renren.com"]

    start_urls = (

        'http://www.renren.com/111111',

        'http://www.renren.com/222222',

        'http://www.renren.com/333333',

    )

    cookies = {

    "anonymid" : "ixrna3fysufnwv",

    "_r01_" : "1",

    "ap" : "327550029",

    "JSESSIONID" : "abciwg61A_RvtaRS3GjOv",

    "depovince" : "GW",

    "springskin" : "set",

    "jebe_key" : "f6fb270b-d06d-42e6-8b53-e67c3156aa7e%7Cc13c37f53bca9e1e7132d4b58ce00fa3%7C1484060607478%7C1%7C1486198628950",

    "t" : "691808127750a83d33704a565d8340ae9",

    "societyguester" : "691808127750a83d33704a565d8340ae9",

    "id" : "327550029",

    "xnsid" : "f42b25cf",

    "loginfrom" : "syshome"

    }

    # 可以重写Spider类的start_requests方法，附带Cookie值，发送POST请求

    def start_requests(self):

        for url in self.start_urls:

            yield scrapy.FormRequest(url, cookies = self.cookies, callback = self.parse_page)

    # 处理响应内容

    def parse_page(self, response):

        with open("deng.html", "wb") as filename:

            filename.write(response.body)

scrapy基础知识之 scrapy 三种模拟登录策略：的更多相关文章

scrapy基础知识之 Scrapy 和 scrapy-redis的区别：
Scrapy 和 scrapy-redis的区别 Scrapy 是一个通用的爬虫框架,但是不支持分布式,Scrapy-redis是为了更方便地实现Scrapy分布式爬取,而提供了一些以redis为基础 ...
JAVA基础知识之多线程——三种实现多线程的方法及区别
所有JAVA线程都必须是Thread或其子类的实例. 继承Thread类创建线程步骤如下, 定义Thead子类并实现run()方法,run()是线程执行体创建此子类实例对象,即创建了线程对象调用 ...
scrapy基础知识之scrapy自动下载图片pipelines
需要在settings.py配置: ITEM_PIPELINES = { 'scrapy.pipelines.images.ImagesPipeline': 1, }import os IMAGES_ ...
0.Python 爬虫之Scrapy入门实践指南（Scrapy基础知识）
目录 0.0.Scrapy基础 0.1.Scrapy 框架图 0.2.Scrapy主要包括了以下组件: 0.3.Scrapy简单示例如下: 0.4.Scrapy运行流程如下: 0.5.还有什么? 0. ...
[SQL] SQL 基础知识梳理（三） - 聚合和排序
SQL 基础知识梳理(三) - 聚合和排序 [博主]反骨仔 [原文]http://www.cnblogs.com/liqingwen/p/5926689.html 序这是<SQL 基础知识梳理 ...
Go基础知识梳理（三）
Go基础知识梳理(三) 结构 type Person struct { name string sex int } func main() { //推荐写法 person := Person{ nam ...
ASP.NET MVC：多语言的三种技术处理策略
ASP.NET MVC:多语言的三种技术处理策略背景本文介绍了多语言的三种技术处理策略,每种策略对应一种场景,这三种场景是: 多语言资源信息只被.NET使用. 多语言资源信息只被Javascrip ...
scrapy基础知识之 CrawlSpiders爬取lagou招聘保存在mysql（分布式）：
items.py import scrapy class LagouItem(scrapy.Item): # define the fields for your item here like: # ...
Java基础知识学习（三）
面向对象部分首先要了解面向对象的思想,与C#一致,都是面向对象的语言访问修饰符 public 共有的,对所有类可见. protected 受保护的,对同一包内的类和所有子类可见. private ...

随机推荐

MVC WebApi
两种web服务 •SOAP风格:基于方法,产品是WebService •REST风格:基于资源,产品是WebAPI 对于数据的增.删.改.查,提供相对的资源操作,按照请求的类型进行相应处理,主要包括G ...
Win8Metro(C#)数字图像处理--2.31灰度拉伸算法
原文:Win8Metro(C#)数字图像处理--2.31灰度拉伸算法 [函数名称] 灰度拉伸函数GrayStretchProcess(WriteableBitmap src) [算法说明] ...
DataTable，DataView 排序和使用
我们都知道在Sql Server可以用order by来排序,所以很多朋友在DataTable中排序也想到了用order by关键字.但这样实现是比较困难的,下面,我们讲解一种比较简单的方法: 控制台 ...
chrome 仿手机
很多网站都通过User-Agent来判断浏览器类型,如果是3G手机,显示手机页面内容,如果是普通浏览器,显示普通网页内容. 谷歌Chrome浏览器,可以很方便地用来当3G手机模拟器.在Windows的 ...
linux+php+swoole解决方案
服务器接收巨量的并发我使用linux+php+swoole解决方案.简单快速高效并发量大稳定 http://www.swoole.com/
树莓派中安装QT
树莓派中安装QT 本文博客链接:http://blog.csdn.net/jdh99,作者:jdh,转载请注明. 环境: 主机:WIN7 硬件:树莓派步骤: 参考链接:http://qt-proje ...
Delphi 使用双缓冲解决图片切换时的闪烁问题 good
var TempCanvas: TCanvas; BufDC: HDC; BufBitmap: HBITMAP; begin // 创建一个与显示设备兼容的内存设备 BufDC := CreateCo ...
Spring中如何获取request的方法汇总及其线程安全性分析
前言本文将介绍在Spring MVC开发的web系统中,获取request对象的几种方法,并讨论其线程安全性.下面话不多说了,来一起看看详细的介绍吧. 概述在使用Spring MVC开发Web系统 ...
SpringCloud-分布式配置中心【加密-非对称加密】
案例代码:https://github.com/q279583842q/springcloud-e-book 非对称加密一.什么是非对称加密(Asymmetric encryption) 二.Jav ...
30255Java_5.5 GUI
GUI GUI的各种元素(如:窗口,按钮,文本框等)由Java类来实现 1.AWT 使用AWT所涉及的类一般在java.awt包及其子包中 AWT(Abstract Window Toolkit)包括 ...

scrapy基础知识之 scrapy 三种模拟登录策略：

注意：模拟登陆时，必须保证settings.py里的 COOKIES_ENABLED (Cookies中间件) 处于开启状态

策略一：直接POST数据（比如需要登陆的账户信息)

策略二：标准的模拟登陆步骤

策略三：直接使用保存登陆状态的Cookie模拟登陆

scrapy基础知识之 scrapy 三种模拟登录策略：的更多相关文章

随机推荐

热门专题

注意：模拟登陆时，必须保证settings.py里的 `COOKIES_ENABLED` (Cookies中间件) 处于开启状态