03爬虫爬取hfutxc成绩

 #-*- coding:utf-8 -*-

 # -*- coding: utf-8 -*-

 #encoding:utf-8

 import urllib

 import urllib2

 import cookielib

 import re

 class SDU:

     def __init__(self):

         self.loginUrl = 'http://222.195.8.201/pass.asp'

         self.gradeUrl = 'http://222.195.8.201/student/asp/Select_Success.asp'

         self.cookies = cookielib.CookieJar()

         self.postdata = urllib.urlencode({

             'UserStyle':'student',

             'user':'',

             'password':'#######'

          })

         self.opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(self.cookies))

     def getPage(self):

         request  = urllib2.Request(

             url = self.loginUrl,

             data = self.postdata)

         result = self.opener.open(request)

         result = self.opener.open(self.gradeUrl)

         return result.read().decode('gbk')

         #打印登录内容

         #print result.read().decode('gbk')

     def getGrades(self):

           #获得本学期成绩页面

           page = self.getPage()

           #正则匹配

           myItems = re.findall('<TR bgcolor.*?<TD>.*?</TD>.*?<TD>(.*?)</TD>.*?<TD align="center">.*?</TD>.*?<TD align="center">(.*?)</TD>.*?</TR>',page,re.S)

           for item in myItems:

               print item[0]+'  '+item[1].strip()+' '

               #self.credit.append(item[0].encode('gbk'))

               #self.grades.append(item[1].encode('gbk'))

           #self.getGrade()

 sdu = SDU()

 sdu.getPage()

 sdu.getGrades()

03爬虫爬取hfutxc成绩的更多相关文章

用Python爬虫爬取广州大学教务系统的成绩（内网访问）
用Python爬虫爬取广州大学教务系统的成绩(内网访问) 在进行爬取前,首先要了解: 1.什么是CSS选择器? 每一条css样式定义由两部分组成,形式如下: [code] 选择器{样式} [/code ...
Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
如何利用Python网络爬虫爬取微信朋友圈动态--附代码（下）
前天给大家分享了如何利用Python网络爬虫爬取微信朋友圈数据的上篇(理论篇),今天给大家分享一下代码实现(实战篇),接着上篇往下继续深入. 一.代码实现 1.修改Scrapy项目中的items.py ...
使用scrapy爬虫,爬取17k小说网的案例-方法一
无意间看到17小说网里面有一些小说小故事,于是决定用爬虫爬取下来自己看着玩,下图这个页面就是要爬取的来源. a 这个页面一共有125个标题,每个标题里面对应一个内容,如下图所示下面直接看最核心spi ...
python爬虫爬取京东、淘宝、苏宁上华为P20购买评论
爬虫爬取京东.淘宝.苏宁上华为P20购买评论 1.使用软件 Anaconda3 2.代码截图三个网站代码大同小异,因此只展示一个 3.结果(部分) 京东淘宝苏宁 4.分析这三个网站上的评论数据 ...
利用Python网络爬虫爬取学校官网十条标题
利用Python网络爬虫爬取学校官网十条标题案例代码: # __author : "J" # date : 2018-03-06 # 导入需要用到的库文件 import urll ...
如何使用robots禁止各大搜索引擎爬虫爬取网站
ps:由于公司网站配置的测试环境被百度爬虫抓取,干扰了线上正常环境的使用,刚好看到每次搜索淘宝时,都会有一句由于robots.txt文件存在限制指令无法提供内容描述,于是便去学习了一波 1.原来一般来 ...
node：爬虫爬取网页图片
代码地址如下:http://www.demodashi.com/demo/13845.html 前言周末自己在家闲着没事,刷着微信,玩着手机,发现自己的微信头像该换了,就去网上找了一下头像,看着图片 ...
简单的python爬虫--爬取Taobao淘女郎信息
最近在学Python的爬虫,顺便就练习了一下爬取淘宝上的淘女郎信息:手法简单,由于淘宝网站本上做了很多的防爬措施,应此效果不太好! 爬虫的入口:https://mm.taobao.com/json/r ...

随机推荐

python操作注册表
#注册表操作 # -*- coding: utf-8 -*- import win32api import win32con #打开注册表:传主键化值,子键值,操作方法(win32con.KEY_AL ...
spring coud Feign常用配置
Ribbon配置在Feign中配置Ribbon非常简单,直接在application.properties中配置即可,如: # 设置连接超时时间 ribbon.ConnectTimeout=500 ...
CSS预处理器—Sass、LESS和Stylus
http://www.w3cplus.com/css/css-preprocessor-sass-vs-less-stylus-2.html 一.什么是CSS预处器 CSS预处理器定义了一种新的语言, ...
zookeeper都有哪些使用场景
分布式协调这个其实是zk很经典的一个用法,比如,A系统发送个请求到mq,然后B拿到消息消费之后处理了.那A系统如何知道B系统的处理结果? 用zk就可以实现分布式系统之间的协调工作.A系统发送请求之后 ...
UE4 日志
第一种输出在控制台中,需要在启动之后的游戏窗口中点击~以打开控制台,然后输入showlog,这时候会弹出一个cmd日志窗口.在程序中使用代码 UE_LOG(LogTemp, Warning, TEX ...
在 Xshell 中使用 hbase shell 进入后无法删除问题
在 Xshell 中使用 hbase shell 进入后无法删除问题: 在hbase shell下,误输入的指令不能使用backspace和delete删除,使用过的人都知道,这是有多坑,有多苦 ...
Ant之build.xml详解
Ant之build.xml详解关键字: ant build.xml Ant的概念可能有些读者并不连接什么是Ant以及入可使用它,但只要使用通过Linux系统得读者,应该知道make这个命令.当编译 ...
1900型USB接口扫描枪设置虚拟串口模式提升扫描速度
在使用扫描枪的过程中,发现扫描二维码速度比较慢,不到100个字符,花了大概2-3秒的时间才完成显示,这个速度不能忍受啊.通过度娘,说是可以将USB键盘模式接收字符转换成虚拟串口接收,这样可以大大提高速 ...
JMeter高并发场景下存在请求无数据
JMeter命令行监控CPU和内存资源
首先确定Agent启动成功客户端

03爬虫 爬取hfutxc成绩

03爬虫 爬取hfutxc成绩的更多相关文章

随机推荐

热门专题

03爬虫爬取hfutxc成绩

03爬虫爬取hfutxc成绩的更多相关文章