Python简单网络爬虫实战—下载论文名称，作者信息（下）

在Python简单网络爬虫实战—下载论文名称，作者信息（上）中，学会了get到网页内容以及在谷歌浏览器找到了需要提取的内容的数据结构，接下来记录我是如何找到所有author和title的

1.从soup中get到data类

soup中提供了select方法来筛选所需的类。该方法使用方法如下：

articlename = soup.select('title')

该语句即将soup中所有的title元素放到articlename中。select也有其他用法

articlename = soup.select('.data') #类前面要加"."

articlename = soup.select('#username')#ID这种唯一的元素，前加"#"

articlename = soup.select('.publ-list .entry.editor .data')#可以组合查找，publ-list类下面的entry.editor类下面的data类，按次序用空格隔开

articlename = soup.select('.publ-list .entry.editor .data .title')[0].contents[0]#title类中第一个元素的第一个文本内容

我们用如下语句get到该网页中所有的data类，这样就包含了所有的author和title，去除了网页中其他无关的元素，离目标更近了一步

soup.select('.publ-list .entry.inproceedings .data')

2.data类中筛选所有author与title

这是一个data类的所有内容。

其中author元素还有更下一级的结构

可以看到，一个data类中author和title元素并不是紧密连接的，在每个authro行之间，有“，”和“：”行隔开，在title行下方，还有dataPublished、genre等元素，但下方的元素都是固定的，行数也固定。因此我把一个.data描述为如下的多维数组：

[

[author1,url,name       ]

[","                    ]

[author2,url,name       ]

[":"                    ]

[<br>                   ]

[title,name             ]

["datePublished",content]

[</article>             ]

]

由于作者数量不固定，因此还要计算作者数量。因为每个author元素后面都会跟一个标点符号，因此似乎只要计算data类的长度减去4，再除以2就可以得到作者数量，然而在实际操作中发现，应该减去5。直到现在我也没有明白原因，可能这里需要补充HTML网站相关的知识。

authornum = int((len(articles)-5)/2)

得到了作者数量，就很容易定位到作者所在的行（下标）和title所在的行（下标）

观察元素内容可以看到，authorname和titlename都是唯一的文本，用以下命令获取即可

for i in range(0,authornum):

    authorlist.append(str(articles.contents[i*2].get_text()))

articlename = str(articles.contents[(authornum+1)*2].get_text())

至此，该脚本的所有难点都搞定啦，接下来就水到渠成，理一下逻辑就ok啦

Python简单网络爬虫实战—下载论文名称，作者信息（下）的更多相关文章

Python开发网络爬虫抓取某同城房价信息
前言: 苦逼的我从某某城市换到另一个稍微大点的某某城市,面临的第一个问题就是买房,奋斗10多年,又回到起点,废话就不多说了,看看如何设计程序把某同城上的房价数据抓取过来. 方案:方案思路很简单,先把网 ...
python网络爬虫实战PDF高清完整版免费下载|百度云盘|Python基础教程免费电子书
点击获取提取码:vg1y python网络爬虫实战帮助读者学习Python并开发出符合自己要求的网络爬虫.网络爬虫,又被称为网页蜘蛛,网络机器人,是一种按照一定的规则,自动地抓取互联网信息的程序或者脚 ...
关于Python网络爬虫实战笔记③
Python网络爬虫实战笔记③如何下载韩寒博客文章 Python网络爬虫实战笔记③如何下载韩寒博客文章 target:下载全部的文章 1. 博客列表页面规则也就是, http://blog.sina ...
Python 利用Python编写简单网络爬虫实例3
利用Python编写简单网络爬虫实例3 by:授客 QQ:1033553122 实验环境 python版本:3.3.5(2.7下报错实验目的获取目标网站“http://bbs.51testing. ...
Python 利用Python编写简单网络爬虫实例2
利用Python编写简单网络爬虫实例2 by:授客 QQ:1033553122 实验环境 python版本:3.3.5(2.7下报错实验目的获取目标网站“http://www.51testing. ...
Python 3网络爬虫开发实战》中文PDF+源代码+书籍软件包
Python 3网络爬虫开发实战>中文PDF+源代码+书籍软件包下载:正在上传请稍后... 本书书籍软件包为本人原创,在这个时间就是金钱的时代,有些软件下起来是很麻烦的,真的可以为你们节省很多 ...
Python 3网络爬虫开发实战中文书籍软件包(原创)
Python 3网络爬虫开发实战中文书籍软件包(原创) 本书书籍软件包为本人原创,想学爬虫的朋友你们的福利来了.软件包包含了该书籍所需的所有软件. 因为软件导致这个文件比较大,所以百度网盘没有加速的 ...
Python 3网络爬虫开发实战中文PDF+源代码+书籍软件包(免费赠送)+崔庆才
Python 3网络爬虫开发实战中文PDF+源代码+书籍软件包+崔庆才下载: 链接:https://pan.baidu.com/s/1H-VrvrT7wE9-CW2Dy2p0qA 提取码:35go ...
《Python 3网络爬虫开发实战中文》超清PDF+源代码+书籍软件包
<Python 3网络爬虫开发实战中文>PDF+源代码+书籍软件包下载: 链接:https://pan.baidu.com/s/18yqCr7i9x_vTazuMPzL23Q 提取码:i ...

随机推荐

memset初始化数组的坑
memset函数常被我们用来初始化数组,然而有个坑可能会被我们踩到. 静态数组初始化一般情形是这样的: #include <cstring> int main() { // 静态数组ar ...
adb常见命令
adb(Android Debug Bridge)主要存放在sdk安装目录下的platform-tools文件夹中,他是一个非常强大的命令行工具.学习adb命令是我在从事兼职测试工作的时候需要掌握 ...
Mybatis 解决问题的记录与博客
问题:mybatis 空值映射的问题Mybatis在使用resultMap来映射查询结果中的列,如果查询结果中包含空值的列(不是null),则Mybatis在映射的时候,不会映射这个字段 https: ...
Autel MaxiIM IM608：如何更新和一些评论
MaxiIM IM608是最先进的,因此是与众不同的一种钥匙编程和诊断工具,它将先进的钥匙编程,所有系统医学和先进的服务融合在一个主要基于10.1英寸触摸屏的机械人中.它配备了XP400关键计算机用户 ...
PC监听鼠标和键盘事件，定时无响应退出
直接上代码: window.onload = function () { initScreenSaver(); } //0912 add function ScreenSaver(settings){ ...
sh_13_字典的应用场景
sh_13_字典的应用场景 # 使用多个键值对,存储描述一个物体的相关信息 —— 描述更复杂的数据信息 # 将多个字典放在一个列表中,再进行遍历 card_list = [ {&quo ...
android 开发随手记
1.Fragment 跳转到Activity 修改数据,修改完后从Activity 返回(返回键)Fragment ,要求刷新Fragment界面的数据解决办法: 在Fragment中注册一个监听广 ...
MySQL的安装教程
一.MYSQL的安装首先登入官网下载mysql的安装包,官网地址:https://dev.mysql.com/downloads/mysql/ 一般下载这个就好,现在的最新版本是5.8,但是据说已经 ...
ERROR: virtualenvwrapper could not find virtualenv in your path
环境: Ubuntu 18.04 Python3 使用pip3安装virtualenv和virtualenvwrapper两个包,ubuntu18.04中,用户使用pip安装的包在~/.local/下 ...
oracle中监听程序当前无法识别连接描述符中请求服务的解决方法
早上同事用PL/SQL连接虚拟机中的Oracle数据库,发现又报了“ORA-12514 TNS 监听程序当前无法识别连接描述符中请求服务”错误,帮其解决后,发现很多人遇到过这样的问题,因此写着这里. ...

Python简单网络爬虫实战—下载论文名称，作者信息（下）

Python简单网络爬虫实战—下载论文名称，作者信息（下）的更多相关文章

随机推荐

热门专题