python简单爬虫用lxml解析页面中的表格

目标：爬取湖南大学2018年在各省的录取分数线，存储在txt文件中

部分表格如图：

部分html代码：

<table cellspacing="0" cellpadding="0" border="1">
   <tbody>
    <tr class="firstRow" >
     <td rowspan="2" ><p ><strong><span >省份</span></strong></p></td>
     <td colspan="4" ><p ><strong><span >文科</span></strong></p></td>
     <td colspan="4" ><p ><strong><span >理科</span></strong></p></td>
    </tr>
    <tr >
     <td ><p ><strong><span >一本线</span></strong></p></td>
     <td ><p ><strong><span >艺术类</span></strong></p></td>
     <td ><p ><strong><span >高校专项计划</span></strong></p></td>
     <td ><p ><strong><span >普通类</span></strong></p></td>
     <td ><p ><strong><span >一本线</span></strong></p></td>
     <td ><p ><strong><span >高校专项计划</span></strong></p></td>
     <td ><p ><strong><span >国家专项计划</span></strong></p></td>
     <td ><p ><strong><span >普通类</span></strong></p></td>
    </tr>
    <tr >
     <td ><p ><strong><span >北京</span></strong></p></td>
     <td  valign="middle" align="left"><p ><span ><strong><span  lang="EN-US">576</span></strong></span></p></td>
     <td  valign="middle" align="left"><br></td>
     <td  valign="middle" align="left"><br></td>
     <td  valign="middle" align="left"><p ><span ><strong><span  lang="EN-US">633</span></strong></span></p></td>
     <td  valign="middle" align="left"><p ><span ><strong><span  lang="EN-US">532</span></strong></span></p></td>
     <td  valign="middle" align="left"><br></td>
     <td  valign="middle" align="left"><br></td>
     <td  valign="middle" align="left"><p ><span ><strong><span  lang="EN-US">624</span></strong></span></p></td>
    </tr>
    <tr >
     <td ><p ><strong><span >天津</span></strong></p></td>
     <td  valign="middle" align="left"><p ><span ><strong><span  lang="EN-US">436/527</span></strong></span></p></td>
     <td  valign="middle" align="left"><br></td>
     <td  valign="middle" align="left"><br></td>
     <td  valign="middle" align="left"><p ><span ><strong><span  lang="EN-US">614</span></strong></span></p></td>
     <td  valign="middle" align="left"><p ><span ><strong><span  lang="EN-US">407/554</span></strong></span></p></td>
     <td  valign="middle" align="left"><br></td>
     <td  valign="middle" align="left"><br></td>
     <td  valign="middle" align="left"><p ><span ><strong><span  lang="EN-US">626</span></strong>&nbsp;</span></p></td>
    </tr>

　　......

    <tr >
     <td ><p ><strong><span >上海</span></strong></p></td>
     <td colspan="8"  valign="top"><p ><strong><span >本科线</span></strong><strong><span  lang="EN-US">/</span></strong><strong><span >自主招生参考线：</span></strong><strong><span  lang="EN-US">401/502</span></strong><strong><span >；</span></strong><strong><span  lang="EN-US">&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; &nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; </span></strong><strong><span >（专业组）最低投档线：<span >533</span></span></strong></p></td>
    </tr>
    <tr >
     <td ><p ><strong><span >浙江</span></strong></p></td>
     <td colspan="8"  valign="top"><p ><strong><span >本科线</span></strong><strong><span  lang="EN-US">/</span></strong><strong><span >一段线：</span></strong><strong><span  lang="EN-US">344/588</span></strong><strong><span >；</span></strong><strong><span  lang="EN-US">&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp; &nbsp;&nbsp; </span></strong><strong><span >（专业）最低投档线：639</span></strong></p></td>
    </tr>
   </tbody>
  </table>

代码：

import requests

from lxml import etree

# 设置URL地址和请求头

url = 'http://admi.hnu.edu.cn/info/1024/3094.htm'

headers = {

    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.92 Safari/537.36',

    'Cookie': 'ASP.NET_SessionId=yolmu555asckw145cetno0um'

}

# 发送请求并解析HTML对象

response = requests.get(url, headers=headers)

html = etree.HTML(response.content.decode('utf-8'))

#  数据解析

table = html.xpath("//table//tr[position()>2]")  # XPath定位到表格，因为页面只有一个表格，所以直接//table，

# 如果有多个表格，如取第二个表格，则写为//table[1] 偏移量为1 。我们不取表头信息，所以从tr[3]开始取，返回一个列表

dep = []

for i in table:  # 遍历tr列表

    p = ''.join(i.xpath(".//td[1]//text()"))  # 获取当前tr标签下的第一个td标签，并用text()方法获取文本内容，赋值给p

    sl = ''.join(i.xpath(".//td[6]//text()"))

    sc = ''.join(i.xpath(".//td[9]//text()"))

    ll = ''.join(i.xpath(".//td[2]//text()"))

    lc = ''.join(i.xpath(".//td[5]//text()"))

    print(p, sl, sc, ll, lc)

    data = {  # 用数据字典，存储需要的信息

        '省份': ''.join(p.split()),  # .split()方法在此处作用是除去p中多余的空格 '\xa0'

        '理科一本线': ''.join(sl.split()),

        '理科投档线': ''.join(sc.split()),

        '文科一本线': ''.join(ll.split()),

        '文科投档线': ''.join(lc.split())

    }

    print(data)

    dep.append(data)

#数据存储

with open('2018enro.txt', 'w', encoding='utf-8') as out_file:

    out_file.write("湖南大学："+"2018年各省录取分数线：\n\n")

    for i in dep:

        out_file.write(str(i)+'\n')

注：原本数据字典是这样写的：

for i in table:

    data = {  # 用数据字典，存储需要的信息

        '省份': ''.join(i.xpath(".//td[1]//text()")),

        '理科一本线': ''.join(i.xpath(".//td[6]//text()")),

        '理科投档线': ''.join(i.xpath(".//td[9]//text()")),

        '文科一本线': ''.join(i.xpath(".//td[2]//text()")),

        '文科投档线': ''.join(i.xpath(".//td[5]//text()"))

    }

输出结果有很多‘\xa0’，其实就是空格，源网页中就字段里就存在很多空格：

plus:解析表格有更好的方法，比如pandas，一步到位！非常方便。

详情请看我的另一篇文章：

https://www.cnblogs.com/cttcarrotsgarden/p/10769097.html

python简单爬虫用lxml解析页面中的表格的更多相关文章

python简单爬虫用lxml库解析数据
目标:爬取湖南大学2018年本科招生章程 url:http://admi.hnu.edu.cn/info/1026/2993.htm 页面部分图片: 使用工具: Python3.7 火狐浏览器 PyC ...
python简单爬虫使用pandas解析表格,不规则表格
url = http://www.hnu.edu.cn/xyxk/xkzy/zylb.htm 部分表格如图: 部分html代码: <table class="MsoNormalTabl ...
Python简单爬虫入门二
接着上一次爬虫我们继续研究BeautifulSoup Python简单爬虫入门一上一次我们爬虫我们已经成功的爬下了网页的源代码,那么这一次我们将继续来写怎么抓去具体想要的元素首先回顾以下我们Bea ...
GJM : Python简单爬虫入门（二） [转载]
感谢您的阅读.喜欢的.有用的就请大哥大嫂们高抬贵手"推荐一下"吧!你的精神支持是博主强大的写作动力以及转载收藏动力.欢迎转载! 版权声明:本文原创发表于 [请点击连接前往] ,未经 ...
python简单爬虫一
简单的说,爬虫的意思就是根据url访问请求,然后对返回的数据进行提取,获取对自己有用的信息.然后我们可以将这些有用的信息保存到数据库或者保存到文件中.如果我们手工一个一个访问提取非常慢,所以我们需要编 ...
Python简单爬虫入门三
我们继续研究BeautifulSoup分类打印输出 Python简单爬虫入门一 Python简单爬虫入门二前两部主要讲述我们如何用BeautifulSoup怎去抓取网页信息以及获取相应的图片标题等信 ...
Python 简单爬虫案例
Python 简单爬虫案例 import requests url = "https://www.sogou.com/web" # 封装参数 wd = input('enter a ...
【转】一张图解析FastAdmin中的表格列表的功能
一张图解析FastAdmin中的表格列表的功能功能描述请根据图片上的数字索引查看对应功能说明. 1.时间筛选器如果想在搜索栏使用时间区间进行搜索,则可以在JS中修改修改字段属性,如 {field: ...
jQuery 中使用 DOM 操作节点，对页面中的表格实现增、删、查、改操作
查看本章节查看作业目录需求说明: 在 jQuery 中使用 DOM 操作节点,对页面中的表格实现增.删.查.改操作点击"增加"超链接时,将表格中的第一条数据添加到表格的末尾 ...

随机推荐

selenium 文件上传
一般分两个场景:一种是input标签,这种可以用selenium提供的send_keys()方法轻松解决: 另外一种非input标签实现起来比较困难,可以借助autoit工具或者SendKeys第三方 ...
极其简单的VSCode C++环境配置
下载我打包的文件VSCode-cpp.7z.001 和 VSCode-cpp.7z.002,解压. 在系统环境变量中添加:你解压的路径\Project\.vscode\MinGW\bin. 打开你解压 ...
vi编辑器使用记录
01. vi 简介 1.1 学习 vi 的目的在工作中,要对服务器上的文件进行简单的修改,可以使用 ssh 远程登录到服务器上,并且使用 vi 进行快速的编辑即可常见需要修改的文件包括: ...
java基础学习之"堆" "栈" "静态存储区" "方法区"
引用部分 java中堆栈(stack)和堆(heap)(还在问静态变量放哪里,局部变量放哪里,静态区在哪里.....进来) Java堆.栈和常量池以及相关String的讲解等我看完"深入理 ...
排查OPENSTACK浮动IP被占用记录
在openstack上新建机器时,发现用户无法登陆. 检查该机器的22端口,返回 Connection refused. ping该IP,发现可以ping通. 释放该浮动ip,然后去ping该 ...
DAY 21内存处理与正则
一.python的垃圾回收机制 1.引用计数(垃圾回收机制的根本) 1.引用计数是用来记录值的内存地址被记录的次数的 2.每一次对值地址的引用都可以使该值的引用计数+1 3.每一次对值地址的释放都可以 ...
MIUI6系统如何启用root权限的教程
MIUI6系统有没有办法启用了root权限?大家都清楚,Android机器有root权限,如果手机启用了root相关权限,就能够实现更好的功能,举例子,大家单位的营销部门同事,使用某些营销软件都需要在 ...
locust启动命令
locust运行测试脚本 locust -f .\load_test.py --host=https://www.baidu.com -f 指定性能测试脚本文件. --host 指定被测试应用的URL ...
Vue-devtools 安装浏览器调试
工欲善其事,必先利其器. 本文主要讲解Vue-devtools的安装和使用安装方法有两个: 方法一:(前提条件需要FQ,省事省力省心方便快速) FQ =>谷歌商店 =>搜索 =>V ...
关于a标签的用法总结
onclick的事件被先执行 ,其次是href中定义的(页面跳转或者javascript) 同时存在两个定义的时候(onclick与href都定义了),如果想阻止href的动作,在onclick必须加 ...

python简单爬虫 用lxml解析页面中的表格

python简单爬虫 用lxml解析页面中的表格的更多相关文章

随机推荐

热门专题

python简单爬虫用lxml解析页面中的表格

python简单爬虫用lxml解析页面中的表格的更多相关文章