使用XPath爬取网页数据

　　我们以我的博客为例，来爬取我所有写过的博客的标题。

　　首先，打开我的博客页面，右键“检查”开始进行网页分析。我们选中博客标题，再次右键“检查”即可找到标题相应的位置，我们继续点击右键，选择Copy，再点击Copy XPath，即可获得对应的XPath编码，我们可以先将它保存在一个文本文档中。

　　我们再多次对各个标题重复以上操作，即可得到关于标题的XPath编码的规律。我们不难看出，对于我的博客的标题的XPath编码格式为“//*[@id="mainContent"]/div/div[n]/div[2]/a”。

　　又因为我的博客共有2页，所以我们还需找到网页url的规律，经过分析，我们发现格式为'https://www.cnblogs.com/Chen-K/default.html?page='+str(i+1)。

　　下面便可开始写代码：

import requests

from lxml import etree

for i in range(0,2):

    url = 'https://www.cnblogs.com/Chen-K/default.html?page='+str(i+1)

    html = requests.get(url)

    etree_html = etree.HTML(html.text)

    a = etree_html.xpath('//*[@id="mainContent"]/div/div/div[2]/a/text()') # 加text()是为了将结果以txt格式输出

    for j in a:

        print(j)

　　运行结果：

　　若是要爬取其他的数据，我们只需复制下来相应的XPath编码即可。操作过程大同小异，我们便不再多加赘述，下面我们以爬取每个博客的url为例：

import requests

from lxml import etree

for i in range(0,2):

    url = 'https://www.cnblogs.com/Chen-K/default.html?page='+str(i+1)

    html = requests.get(url)

    etree_html = etree.HTML(html.text)

    a = etree_html.xpath('//*[@id="mainContent"]/div/div/div[2]/a/@href')

    for j in a:

        print(j)

　　运行结果：

　　XPath与BeautifulSoup相比，操作更加简单，代码也更为简洁，如果需要爬取比较多的信息，使用XPath将会大大减少我们的工作量。当然，我们想要使用XPath，必须先安装lxml库，而我们有两个方法可以安装lxml库。

　　1、使用pip安装

　　我们只需打开命令行，输入指令“pip install lxml”，然后等待安装即可。

　　2、使用PyCharm安装

　　我们点击“文件”，找到设置，打开后点击右边的加号，然后在上面的搜索框中输入lxml，然后点击下方install，等待安装即可。

　　安装好lxml库之后，我们便可以使用其相关功能了。

使用XPath爬取网页数据的更多相关文章

爬虫系列4：Requests+Xpath 爬取动态数据
爬虫系列4:Requests+Xpath 爬取动态数据 [抓取]:参考前文爬虫系列1:https://www.cnblogs.com/yizhiamumu/p/9451093.html [分页]:参 ...
使用webdriver+urllib爬取网页数据(模拟登陆，过验证码)
urilib是python的标准库,当我们使用Python爬取网页数据时,往往用的是urllib模块,通过调用urllib模块的urlopen(url)方法返回网页对象,并使用read()方法获得ur ...
python之爬取网页数据总结（一）
今天尝试使用python,爬取网页数据.因为python是新安装好的,所以要正常运行爬取数据的代码需要提前安装插件.分别为requests Beautifulsoup4 lxml 三个插件 ...
python爬虫——爬取网页数据和解析数据
1.网络爬虫的基本概念网络爬虫(又称网络蜘蛛,机器人),就是模拟客户端发送网络请求,接收请求响应,一种按照一定的规则,自动地抓取互联网信息的程序.只要浏览器能够做的事情,原则上,爬虫都能够做到. 2 ...
使用 Python 爬取网页数据
1. 使用 urllib.request 获取网页 urllib 是 Python 內建的 HTTP 库, 使用 urllib 可以只需要很简单的步骤就能高效采集数据; 配合 Beautiful 等 ...
03：requests与BeautifulSoup结合爬取网页数据应用
1.1 爬虫相关模块命令回顾 1.requests模块 1. pip install requests 2. response = requests.get('http://www.baidu.com ...
Selenium+Tesseract-OCR智能识别验证码爬取网页数据
1.项目需求描述通过订单号获取某系统内订单的详细数据,不需要账号密码的登录验证,但有图片验证码的动态识别,将获取到的数据存到数据库. 2.整体思路 1.通过Selenium技术,无窗口模式打开浏览器 ...
【推荐】oc解析HTML数据的类库（爬取网页数据）
TFhpple是一个用于解析html数据的第三方库,本人感觉功能还算可以,只不过在使用前必须配置项目. 配置 1.导入libxml2.tbd 2.设置编译路径使用这里使用一个例子来说明 http: ...
使用puppeteer爬取网页数据实践小结
简单介绍Puppeteer Puppeteer是一个Node库,它通过DevTools协议提供高级API来控制Chrome或Chromium.Puppeteer默认以无头方式运行,但可以配置为有头方式 ...

随机推荐

Django中的返回json对象的方式
在返回json对象的几种方式: 1 from django.shortcuts import render, HttpResponse # Create your views here. from d ...
linux下编辑VI窗口插入与编辑命令
前言在嵌入式linux开发中,进行需要修改一下配置文件之类的,必须使用vi,因此,熟悉 vi 的一些基本操作,有助于提高工作效率. 一,模式 vi编辑器有3种模式:命令模式.输入模式.末行模式.掌握 ...
setInterval、clearInterval的回调函数，实现函数间调用的先后顺序
定义: var waitUnitil=function (untillCallBack, nextStepCallBack, count) { if (count == null) { count = ...
JAXB序列化对象与反序列化XML
1.什么是JAXB JAXB(Java Architecture for XML Binding) 是一个业界的标准,是一项可以根据XML Schema产生Java类的技术. 该过程中,JAXB也提供 ...
如何用最快的速度读出大小为10G的文件的行数?弄懂 python 的迭代器
with open('rm_keys.txt', 'r', encoding = 'utf-8') as f: count = 0 for line in f: 7 count += 1 print( ...
解决mosh: Nothing received from server on UDP port 60001 环境: centos7.1
主要问题在于有的教程使用iptables命令来开启对应端口, 但是centos7.1中虽然iptables仍然存在, 但是没有默认安装相关服务, 而是使用firewalld来管理防火墙. 所以我开始以 ...
jquery防止快速点击
jquery防止快速点击(推荐第三种方式) //全站ajax加载提示 (function ($) { var str = '<div class="ajax-status" ...
HDU4513 【mannacher算法】
题目链接http://acm.hdu.edu.cn/showproblem.php?pid=4513 Problem Description 吉哥又想出了一个新的完美队形游戏! 假设有n个人按顺序站在 ...
Python基础总结之第八天开始【while循环以及for循环,循环嵌套等循环相关的知识点】（新手可相互督促）
ennnnn,年薪20万的梦想是不是又进了一步: 循环,什么是循环,循环就是电池有电,手机屏幕可以循环一整天的使用:循环就是地球不毁灭,太阳日复一日的出现...... 不接受反驳,谢谢!~ 只要条件满 ...
bootstrap-table的一些配置参数例子
$('#reportTable').bootstrapTable({ method: 'post', url: '/qStock/AjaxPage', dataType: "json&quo ...

使用XPath爬取网页数据

使用XPath爬取网页数据的更多相关文章

随机推荐

热门专题