Python爬虫常用之HtmlParser

HtmlParser，顾名思义，是解析Html的一个工具。python自带的。

一、常用属性和方法介绍

　　HtmlParser是一个类，在使用时一般继承它然后重载它的方法，来达到解析出需要的数据的目的。

　　1.常用属性：

　　　　lasttag，保存上一个解析的标签名，是字符串。

　　2.常用方法：　

handle_starttag(tag, attrs) ，处理开始标签，比如<div>；这里的attrs获取到的是属性列表，属性以元组的方式展示
　　　　handle_endtag(tag) ，处理结束标签,比如</div>
　　　　handle_startendtag(tag, attrs) ，处理自己结束的标签，如<img />
　　　　handle_data(data) ，处理数据，标签之间的文本
　　　　handle_comment(data) ，处理注释，之间的文本

二、基本使用

　　不多说，上代码

from html.parser import HTMLParser
 
class MyHTMLParser(HTMLParser):
 
    def handle_starttag(self, tag, attrs):
        """
        recognize start tag, like <div>
        :param tag:
        :param attrs:
        :return:
        """
        print("Encountered a start tag:", tag)
 
    def handle_endtag(self, tag):
        """
        recognize end tag, like </div>
        :param tag:
        :return:
        """
        print("Encountered an end tag :", tag)
 
    def handle_data(self, data):
        """
        recognize data, html content string
        :param data:
        :return:
        """
        print("Encountered some data  :", data)
 
    def handle_startendtag(self, tag, attrs):
        """
        recognize tag that without endtag, like <img />
        :param tag:
        :param attrs:
        :return:
        """
        print("Encountered startendtag :", tag)
 
    def handle_comment(self,data):
        """
 
        :param data:
        :return:
        """
        print("Encountered comment :", data)
 
parser = MyHTMLParser()
parser.feed('<html><head><title>Test</title></head>'
            '<body><h1>Parse me!</h1><img src = "" />'
            '<!-- comment --></body></html>')

　　以上是根据python手册写的基本使用，解析了一个简单的html。可以运行看看，主要用于了解各个函数负责解析的部分，以及解析顺序。

三、实用案例

　　以下的实用案例均在上面的代码中修改对应函数，每个实例都是单独的。

　　解析的html如下：

<html>
    <head>
        <title>Test</title>
    </head>
    <body>
        <h1>Parse me!</h1>
        <img src = "" />
        <p>A paragraph.</p>
                <p class = "p_font">A paragraph with class.</p>
                <!-- comment -->
        <div>
            <p>A paragraph in div.</p>
        </div>
    </body>
</html>

　　1.获取属性的函数，是个静态函数，新增的。直接定义在类中，返回属性名对应的属性

def _attr(attrlist, attrname):
    for attr in attrlist:
        if attr[0] == attrname:
            return attr[1]
    return None

　　2.获取所有p标签的文本，最简单方法只修改handle_data

def handle_data(self, data):
    if self.lasttag == 'p':
        print("Encountered p data  :", data)

　　3.获取css样式（class）为p_font的p标签的文本，使用了案例1，增加一个实例属性作为标志，选取需要的标签

def __init__(self):
    HTMLParser.__init__(self)
    self.flag = False
 
def handle_starttag(self, tag, attrs):
    if tag == 'p' and _attr(attrs, 'class') == 'p_font':
        self.flag = True
 
def handle_data(self, data):
    if self.flag == True:
        print("Encountered p data  :", data)

　　4.获取p标签的属性列表

def handle_starttag(self, tag, attrs):
    if tag == 'p':
        print("Encountered p attrs  :", attrs)

　　5.获取p标签的class属性

def handle_starttag(self, tag, attrs):
    if tag == 'p' and _attr(attrs, 'class'):
        print("Encountered p class  :", _attr(attrs, 'class'))

　　6.获取div下的p标签的文本

def __init__(self):
    HTMLParser.__init__(self)
    self.in_div = False
 
def handle_starttag(self, tag, attrs):
    if tag == 'div':
        self.in_div = True
 
def handle_data(self, data):
    if self.in_div == True and self.lasttag == 'p':
        print("Encountered p data  :", data)

　　7.处理注释中的标签，若需要的数据在注释中，使用一般函数解析不到

　　处理方法为，写两个类，继承HTMLParser。在其中一个类的handle_comment里实例化解析类，和其他标签一样解析

　　这里的MyHTMLParser可以为基本使用中的MyHTMLParser，或者按需重写。

class CommentHTMLParser(HTMLParser):
    def __init__(self):
        HTMLParser.__init__(self)
 
    def handle_comment(self,data):
        cparser = MyHTMLParser()
        cparser.feed(data)

Python爬虫常用之HtmlParser的更多相关文章

Python爬虫常用小技巧之设置代理IP
设置代理IP的原因我们在使用Python爬虫爬取一个网站时,通常会频繁访问该网站.假如一个网站它会检测某一段时间某个IP的访问次数,如果访问次数过多,它会禁止你的访问.所以你可以设置一些代理服务器来 ...
爬虫-Python爬虫常用库
一.常用库 1.requests 做请求的时候用到. requests.get("url") 2.selenium 自动化会用到. 3.lxml 4.beautifulsoup 5 ...
python爬虫常用第三方库
这个列表包含与网页抓取和数据处理的Python库网络通用 urllib -网络库(stdlib). requests -网络库. grab – 网络库(基于pycurl). pycurl – 网络 ...
Python 爬虫常用的库
一.常用库 1.requests 做请求的时候用到. requests.get("url") 2.selenium 自动化会用到. 3.lxml 4.beautifulsoup 5 ...
Python爬虫常用之PyQuery
PyQuery是解析页面常用的库.是python对jquery的封装.下面是一份解析基本页面的代码.后期用到复杂或者实用的方式再增加. from pyquery import PyQuery as p ...
Python爬虫常用：谷歌浏览器驱动——Chromedriver 插件安装教程
我们在做爬虫的时候经常要使用谷歌浏览器驱动,今天分享下这个Chromedriver 插件的安装方法. 第一步:打开谷歌浏览器打开设置面板嫌枯燥的小伙伴可以点击此处找管理员小姐姐领取免费资料第二步: ...
python爬虫常用之Scrapy 中间件
一.概述 1.中间件的作用在scrapy运行的整个过程中,对scrapy框架运行的某些步骤做一些适配自己项目的动作. 例如scrapy内置的HttpErrorMiddleware,可以在http请求 ...
python爬虫常用之Scrapy 简述
一.安装 pip install scrapy. 如果提示需要什么包就装什么包有的包pip安装不起,需要自己下载whl文件进行安装. 二.基本的爬虫流程通用爬虫有如下几步: 构造url --> ...
Python爬虫常用之登录(三) 使用http请求登录
前面说了使用浏览器登录较为简单,不需要过多分析,而使用请求登录恰恰就是以分析为主. 开发一个请求登录程序的流程: 分析请求->模拟请求->测试登录->调整参数->测试登录-&g ...

随机推荐

C# DateTime.ToString()的各种日期格式
DateTime.ToString()的各种日期格式例: ToString:2016/9/27 0:00:00 ToString("yyyy/MM/dd"):2016/09/27 ...
现代C++学习笔记之一资料篇（C++ 11）
最近看网上一些开源的源代码,发现尽多不认识的符号,好吧.开始学习新的C++. C++经典书籍 C++ Primer,第五版开始有了对C++ 11的讲解 C++ Primer Plus,第六版有对C++ ...
javaweb dom4j解析xml文档
1.什么是dom4j dom4j是一个Java的XML API,是jdom的升级品,用来读写XML文件的.dom4j是一个十分优秀的JavaXML API,具有性能优异.功能强大和极其易使用的特点,它 ...
编写高质量代码改善C#程序的157个建议——建议7：将0值作为枚举的默认值
建议7: 将0值作为枚举的默认值允许使用的枚举类型有byte.sbyte.short.ushort.int.uint.long和ulong.应该始终将0值作为枚举类型的默认值.不过,这样做不是因为允 ...
20169219 实验四Android程序设计
一.实现Linux下dc的功能,计算后缀表达式的值 public int evaluate(String expr) { int op1, op2, result = 0; String token; ...
ICallbackEventHandler使用
后端:页面需继承ICallbackEventHandler protected void Page_Load(object sender, EventArgs e) { if (!IsPostBack ...
C#多线程编程实战1.2暂停线程（休眠）
using System;using System.Collections.Generic;using System.Linq;using System.Text;using System.Threa ...
Linux 内核list_head 学习
Linux 内核list_head 学习(一) http://www.cnblogs.com/zhuyp1015/archive/2012/06/02/2532240.html 在Linux内核中,提 ...
OOP1(定义基类和派生类)
面向对象程序设计基于三个基本概念:数据抽象,继承和动态绑定数据抽象是一种依赖于接口和实现分离的编程技术.继承和动态绑定对程序的编号有两方面的影响:一是我们可以更容易地定义与其它类相似但不完全相同的类 ...
[AGC005C]Tree Restoring 构造
Description 给出一个数组a,要求构造一颗树,使节点x距离最远的点的距离为\(a_x\). Input 第一行一个正整数NN(2≤N≤1002≤N≤100) 接下来一行,有NN个 ...

Python爬虫常用之HtmlParser

Python爬虫常用之HtmlParser的更多相关文章

随机推荐

热门专题