python--实践--模拟浏览器（http）登陆

#方法一：直接使用coookies登陆，此方法需要提前在浏览器中使用账号密码登陆后，获取浏览器中的cookies，在构造的请求中携带这个cookies（缺点是有时效性）。

#方法二：通过账号密码（From data）登陆，在登陆后获得其中的cookies，之后的对需要登陆的页面操作，只需要携带这个cookies即可

 #以下代码是利用方法1

 # -*- coding: utf-8 -*-

 import requests;

 import sys;

 import io;

 #重点：标准解析库

 from bs4 import BeautifulSoup;

 sys.stdout = io.TextIOWrapper(sys.stdout.buffer,encoding='utf8'); #改变标准输出的默认编码

 #根据cookies访问后台

 url = 'http://域名/other/other.comment.wall.php?ac=l&id=&fid=&uid=&title=&source=0&status=0&b_time=&e_time=';

 #浏览器登录后得到的cookie，也就是刚才复制的字符串

 cookie_str = r'PHPSESSID=9f20c6bb676841f38aee8589aceb5c7f; username=zhonghuihong; password=XXX';

 #把cookie字符串处理成字典，以便接下来使用

 cookies = {};

 for line in cookie_str.split(';'):

 key, value = line.split('=', 1);

 cookies[key] = value;

 #设置请求头,直接复制即可

 headers = {'User-agent':'Mozilla/5.0 (Linux; Android 6.0; Nexus 5 Build/MRA58N) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/46.0.2490.76 Mobile Safari/537.36'};

 疑问：请求头header是不是必须要加

 搜罗网上的答复：

23 ①、不加，直接裸着请求url，似乎也没有报错，自己尝试也是这样

24 ②、防止封ip，加上准没错

25 ③、禁止反扒机制，输出的text信息中会出现抱歉，无法访问等字眼，这就是禁止爬取（headers是解决requests请求反爬的方法之一，相当于我们进去这个网页的服务器本身，假装自己本身在爬取数据）

26 ④、作为一个良好的习惯，最好都要加上

 疑问二：请求头里面已经含有cookies,请求时是否还要重复添加一个cookies=cookies参数

 根据自己的实践：不需要重复添加

 疑问三：为什么访问android端的接口基本不用提前设置header

 header里面是手机端信息，通过手机端页面去爬不会那么容易被封（这个是询问网友来着，至今不知道原因），根据目前实践确实不需要

 #在发送get请求时带上请求头和cookies（）

 resp = requests.get(url, headers = headers, cookies = cookies);

 html_resp=resp.content.decode('UTF-8');

 #print(resp.content.decode('utf-8'));

 soup_string = BeautifulSoup(html_resp, 'html.parser');

 soup_table=soup_string.find(attrs={'class':'table table-striped table-bordered table-hover'});

 #print(soup_table);

 soup_str=soup_table.findAll(attrs={'style':'text-align:center;vertical-align:middle;word-break:break-all; word-wrap:break-all;'});

 print(soup_str);

 #for soup in soup_str:

 #print(soup.string);

 #book_div = soup_string.find(attrs={"id":"book"})

 #book_a = book_div.findAll(attrs={"class":"title"})

 #for book in book_a:

 #print book.string

 #print(soup_string);

python--实践--模拟浏览器（http）登陆的更多相关文章

python模拟浏览器webdriver登陆网站后抓取页面并输出
关键在于以下两行代码特别是find_element_by_xpath写法很多写成 findElementsByXpath不知道是写错了还是高级版本是这么写的... #webElement = s ...
九、Python+Selenium模拟用QQ登陆腾讯课堂，并提取报名课程（练习）
研究QQ登录规则的话,得分析大量Javascript的加密解密,比较耗时间.自己也是练习很少,短时间成功不了.所以走了个捷径. Selenium是一个WEB自动化测试工具,它运行时会直接实例化出一个浏 ...
python selenium模拟登陆163邮箱。
selenium是可以模拟浏览器操作. 有些爬虫是异步加载的,通过爬取网页源码是得不到需要的内容.所以可以模拟浏览器去登陆该网站进行爬取操作. 需要安装selenium通过pip install xx ...
python爬虫:使用Selenium模拟浏览器行为
前几天有位微信读者问我一个爬虫的问题,就是在爬去百度贴吧首页的热门动态下面的图片的时候,爬取的图片总是爬取不完整,比首页看到的少.原因他也大概分析了下,就是后面的图片是动态加载的.他的问题就是这部分动 ...
Spider-Python爬虫之使用Selenium模拟浏览器行为
分析他的代码比较简单,主要有以下的步骤:使用BeautifulSoup库,打开百度贴吧的首页地址,再解析得到id为new_list标签底下的img标签,最后将img标签的图片保存下来. header ...
python urllib2 模拟网站登陆
python urllib2 模拟网站登陆 1. 可用浏览器先登陆,然后查看网页源码,分析登录表单 2. 使用python urllib2,cookielib 模拟网页登录 import urllib ...
【小白学爬虫连载（10）】–如何用Python实现模拟登陆网站
Python如何实现模拟登陆爬取Python实现模拟登陆的方式简单来说有三种:一.采用post请求提交表单的方式实现.二.利用浏览器登陆网站记录登陆成功后的cookies,采用get的请求方式,传入c ...
Python开发爬虫之动态网页抓取篇：爬取博客评论数据——通过Selenium模拟浏览器抓取
区别于上篇动态网页抓取,这里介绍另一种方法,即使用浏览器渲染引擎.直接用浏览器在显示网页时解析 HTML.应用 CSS 样式并执行 JavaScript 的语句. 这个方法在爬虫过程中会打开一个浏览器 ...
python下selenium模拟浏览器基础操作
1.安装及下载 selenium安装: pip install selenium 即可自动安装selenium geckodriver下载:https://github.com/mozilla/ge ...
Python实现模拟登陆
大家经常会用Python进行数据挖掘的说,但是有些网站是需要登陆才能看到内容的,那怎么用Python实现模拟登陆呢?其实网路上关于这方面的描述很多,不过前些日子遇到了一个需要cookie才能登陆的网站 ...

随机推荐

Laravel 5.2数据库--填充数据
1.简介 Laravel 包含了一个简单方法来填充数据库——使用填充类和测试数据.所有的填充类都位于database/seeds目录.填充类的类名完全由你自定义,但最好还是遵循一定的规则,比如可读性, ...
python字符串,列表常用操作
24天养成一个好习惯,第五天! 一.字符串需要掌握的操作 1.取值(索引取值)需要注意的是只能取,不能改 msg = 'hello world' print(msg[4]) 2.切片(顾头不顾尾) m ...
生产环境优雅的重启基于Nginx、Tornado的Web服务进程
Nginx是一个高效的Web服务器及代理服务器,Tornado是一个基于epoll的异步Web开发框架,通常使用Nginx做为Web服务器时,都会以FastCGI模式,而我们从开发.调试.运维的角度考 ...
Codeforces 1039D You Are Given a Tree [根号分治，整体二分，贪心]
洛谷 Codeforces 根号分治真是妙啊. 思路考虑对于单独的一个$k$如何计算答案. 与"赛道修建"非常相似,但那题要求边,这题要求点,所以更加简单. 在每一个点贪心地 ...
swift 学习- 12 -- 方法
// 方法是与某些特定类型相关的函数. 类, 结构体,枚举都可以定义实例方法, 实例方法为给类型的实例封装了具体的任务与功能. 类, 结构体, 枚举也可以定义类型方法, 类型方法与类型本身 ...
【MySql】join操作
飞机票飞机票加油 INNER JOIN(内连接,或等值连接):获取两个表中字段匹配关系的记录. LEFT JOIN(左连接):获取左表所有记录,即使右表没有对应匹配的记录. RIGHT JOIN( ...
Confluence 6 使用 WebDAV 客户端来对页面进行操作
下面的部分告诉你如何在不同的系统中来设置原生的 WebDAV 客户端,这个客户端通常显示在你操作系统的文件浏览器中,例如,Windows 的 Windows Explorer 或者 Linux 的 K ...
Confluence 6 找到在创建 XML 备份的时候出现的错误
错误可能是因为数据库突然不可访问而产生.如果你在你的日志中看到了错误 'Couldn't backup database data' ,这个指南将会帮助你更正这个错误.我们强烈推荐你备份 Confl ...
Swift中使用oc代码桥接设置
1 将oc的代码拖入项目中 2 新建一个头文件在头文件中导入你想用的oc头文件 import "****.h" 3 在设置build Setting 中搜索bird 找到 Ob ...
【JS】中ajax的URL中包含中文，后台接收乱码
[问题]ajax提交get请求,url中参数包含中文,后台接收到显示乱码. [解决方案]前台: function getSiteInfoByName(siteName){ var res; $.aja ...

python--实践--模拟浏览器（http）登陆

python--实践--模拟浏览器（http）登陆的更多相关文章

随机推荐

热门专题