Python实现模拟登陆

大家经常会用Python进行数据挖掘的说，但是有些网站是需要登陆才能看到内容的，那怎么用Python实现模拟登陆呢？其实网路上关于这方面的描述很多，不过前些日子遇到了一个需要cookie才能登陆的网站，而且这个网站还有些问题，于是费了好大的劲才搞定，现在贴出来给大家分享下。

首先是用Python3标准库里的urllib包实现的一个版本，不需要考虑许多细节：

 #! /usr/bin/env python

 # -*- coding:utf-8 -*-

 import urllib.request

 import urllib.parse

 import http.cookiejar

 StudentInfoURL = 'http://210.x.x.1:90/student/index.jsp'

 loginURL = 'http://210.x.x.1:90/login.jsp'

 loginCheckURL = 'http://210.x.x.1:90/j_security_check'

 post_data = urllib.parse.urlencode({'j_username': 'xxxxxxx', 'j_password': 'xxxxxxx'})

 headers = {

     'Content-Type': 'application/x-www-form-urlencoded',

     'UserAgent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_9_1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/32.0.1700.107 Safari/537.36'

 }

 cj = http.cookiejar.CookieJar()

 opener = urllib.request.build_opener(urllib.request.HTTPCookieProcessor(cj))

 #此处一定要链接一次，否则得不到cookie

 opener.open(loginCheckURL)

 urllib.request.install_opener(opener)

 ######################此处加入异常处理，再登一次即可######################

 request = urllib.request.Request(loginCheckURL, post_data, headers)

 try:

     response = urllib.request.urlopen(request)

 except:

     response = urllib.request.urlopen(request)

 print(response.read().decode('GBK'))

 ######################可以开始正常访问啦######################

 request = urllib.request.Request(StudentInfoURL, headers=headers)

 fp =  urllib.request.urlopen(request)

 print(fp.read().decode('GBK'))

下面是另一个版本，用的是比较底层的http包里的client模块实现的，个人很喜欢这个版本：

 #!/usr/bin/env python

 #  -*- coding:utf-8 -*-

 import http.client

 ###########################################################

 HOST = '210.x.x.1:90'

 UserName =  "xxxxxxx"

 PassWord =  "xxxxxxx"

 data =  "j_username=%s&j_password=%s"        %(UserName,PassWord)

 Headers = {

     "Content-Type":"application/x-www-form-urlencoded",

     "User-Agent":"Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 6.1; Trident/4.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET CLR 3.0.30729)",

     }

 ###########################################################

 #连接服务器

 conn = http.client.HTTPConnection(HOST,timeout=30)

 conn.connect()

 #GET到登录页，以获取cookies

 conn.request("GET","/j_security_check",None,Headers)

 res = conn.getresponse()

 m_cookie = res.getheader("Set-Cookie").split(';')[0]

 res.read()

 #POST到登录页，进行登录

 Headers["Cookie"] = m_cookie

 conn.request("POST","/j_security_check",data,Headers)

 res = conn.getresponse()

 res.read()

 if res.status == 400:

     #再次链接到登录页

     conn.request("POST","/j_security_check",data,Headers)

     res = conn.getresponse()

     res.read()

 conn.close()

 ######################可以开始正常访问啦######################

 conn2 = http.client.HTTPConnection(HOST)

 conn2.request("GET","/student/index.jsp",None,Headers)

 fp = conn2.getresponse()

 print(fp.status)

 print(fp.read().decode("GBK"))

 ###########################################################

欢迎大家批评

Python实现模拟登陆的更多相关文章

【小白学爬虫连载（10）】–如何用Python实现模拟登陆网站
Python如何实现模拟登陆爬取Python实现模拟登陆的方式简单来说有三种:一.采用post请求提交表单的方式实现.二.利用浏览器登陆网站记录登陆成功后的cookies,采用get的请求方式,传入c ...
python爬虫模拟登陆
python爬虫模拟登陆学习了:https://www.cnblogs.com/chenxiaohan/p/7654667.html 用的这个学习了:https://www.cnblogs.co ...
Python 爬虫模拟登陆知乎
在之前写过一篇使用python爬虫爬取电影天堂资源的博客,重点是如何解析页面和提高爬虫的效率.由于电影天堂上的资源获取权限是所有人都一样的,所以不需要进行登录验证操作,写完那篇文章后又花了些时间研究了 ...
python爬虫模拟登陆校园网-初级
最近跟同学学习爬虫的时候看到网上有个帖子,好像是山大校园网不稳定,用py做了个模拟登陆很有趣,于是我走上了一条不归路..... 先上一张校园网截图首先弄清一下模拟登陆的原理: 1:服务器判定浏览器登 ...
Python作业模拟登陆(第一周)
模拟登陆:1. 用户输入帐号密码进行登陆2. 用户信息保存在文件内3. 用户密码输入错误三次后锁定用户思路: 1. 用户名密码文件为passwd,锁定用户文件为lock 2. 用户输入账号密码采用i ...
python+requests模拟登陆学校选课系统
最近学校让我们选课,每天都有不同的课需要选....然后突发奇想试试用python爬学校选课系统的课程信息先把自己的浏览器缓存清空,然后在登陆界面按f12 如图: 可以看到登陆时候是需要验证码的,验证 ...
python selenium模拟登陆163邮箱。
selenium是可以模拟浏览器操作. 有些爬虫是异步加载的,通过爬取网页源码是得不到需要的内容.所以可以模拟浏览器去登陆该网站进行爬取操作. 需要安装selenium通过pip install xx ...
Python脚本模拟登陆DVWA
目录 requests模拟登陆 Selenium自动化测试登陆环境:python3.7 windows requests模拟登陆我们登陆DVWA的时候,看似只有一步:访问网站,输入用户名和密码,登 ...
python requests 模拟登陆网站，抓取数据
抓取页面数据的时候,有时候我们需要登陆才可以获取页面资源,那么我们需要登陆以后才可以跳转到对应的资源页面,那么我们需要通过模拟登陆,登陆成功以后再次去抓取对应的数据. 首先我们需要通过手动方式来登陆一 ...

随机推荐

js获取当前时间,js时间函数
Js获取当前日期时间及其它操作,js时间函数 var myDate = new Date(); myDate.getYear(); //获取当前年份(2位) myDate.getFullYear(); ...
Enable test automation in Testlink
Enabling Test Automation in Testlink Step 1: Change config settings in testlink config file Edit c ...
Cocos2d-x 开发手记
1.所有的源文件统一新建到Classes里,否则无法找到源文件,这样也便于跨平台编译 2.绘图坐标系,与opengl采用相同坐标系,左下角为原点纹理坐标系,以左上角为原点 3.最近有在学习C ...
（转载）NSTimer
转自:http://www.cnblogs.com/smileEvday/archive/2012/12/21/NSTimer.html 看到这个标题,你可能会想NSTimer不就是计时器吗,谁不会用 ...
【英语】Bingo口语笔记(71) - shit系列
【Python】logging模块学习笔记
因为做接口自动化测试遇到的一个代码逻辑上的问题,又不知道具体问题出在哪里,所以在模块化代码之前,先学习下python的日志模块logging. 入门1 入门2 日志级别大小关系为:CRITICAL & ...
五：分布式事务一致性协议paxos的应用场景
1.应用场景 (1)分布式中的一致性 Paxos算法主要是解决一致性问题,关于“一致性”,在不同的场景有不同的解释: NoSQL领域:一致性更强调“能读到新写入的”,就是读写一致性数据库领域:一致性强 ...
shell script入门
从程序员的角度来看, Shell本身是一种用C语言编写的程序,从用户的角度来看,Shell是用户与Linux操作系统沟通的桥梁.用户既可以输入命令执行,又可以利用 Shell脚本编程,完成更加复杂的操 ...
source 命令
作用: 当我修改了/etc/profile文件,我想让它立刻生效,而不用重新登录:这时就想到用source命令,如:source /etc/profile 介绍:source命令也称为“点命令”,也就 ...
The Network Adapter could not establish the connection解决办法
用 oracle net manager 将监听改为IP地址,将服务命名也改为IP地址,然后数据库连接改为IP地址方式不要用localhost

Python实现模拟登陆

Python实现模拟登陆的更多相关文章

随机推荐

热门专题