简介：

Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式.

使用

from bs4 import BeautifulSoup

html_doc = """
<html><head><title>The Dormouse's story</title></head>
<body>
<p class="sister"><b>$37</b></p>

<p class="story" id="p">Once upon a time there were three little sisters; and their names were
<a href="http://example.com/elsie" class="sister" >Elsie</a>,
<a href="http://example.com/lacie" class="sister" id="link2">Lacie</a> and
<a href="http://example.com/tillie" class="sister" id="link3">Tillie</a>;
and they lived at the bottom of a well.</p>

<p class="story">...</p>
"""

生成beautifulSoup对象：

方式一:

soup = BeautifulSoup(html_doc, "lxml")

print(soup)

方式二:

soup = BeautifulSoup(open('a.html'), "lxml")

print(soup)

soup = BeautifulSoup(html_doc, "lxml")

常用获取方法：

自动补全

soup.prettify()

print(soup.p)

获取p标签下的b标签

print(soup.p.b)

 获取p标签下的b标签下的文本

print(soup.p.b.text)

找body内的所有标签

print(soup.body.contents)

获取p标签属性

print(soup.p.attrs)

获取p标签的孩子， 返回一个iter对象

print(list(soup.p.children))

获取p标签的子子孙孙

print(list(soup.p.descendants))

获取p标签的爸爸

print(soup.p.parent)

获取p标签的爸爸， 获取p标签的爸爸的爸爸， 获取p标签的爸爸的爸爸的爸爸

print(list(soup.p.parents))

获取a标签内的href属性

print(soup.a.attrs['href'])

五种过滤器：

搜索文档树
1.文本查找

通过文本查找p标签

print(soup.find_all(name='p'))

通过文本查找文本为$37的p标签

print(soup.find_all(name='p', text='$37'))

通过文本查找id为link3的a标签

print(soup.find_all(name='a', attrs={"id": "link3"}))

2.正则查找

通过正则查找所有p标签

import re

print(soup.find_all(name=re.compile("^p")))

通过正则查找所有a标签

print(soup.find_all(name=re.compile("^a")))

通过正则查找所有id为link的p标签

print(soup.find_all(name="p", attrs={"id": re.compile("^link")}))

通过正则查找所有id为link的a标签

print(soup.find_all(name="a", attrs={"id": re.compile("^link")}))

通过正则查找所有class为story的p标签

print(soup.find_all(name="p", attrs={"class": re.compile("story")}))

3.列表

通过列表查找所有的a、p标签

print(soup.find_all(name=['p', 'a']))

通过列表查找所有的正则匹配有Elsie的文本

print(soup.find_all(text=[re.compile("Elsie")]))

通过列表查找所有的正则匹配有Elsie的文本的a标签

print(soup.find_all(name=['a'], text=[re.compile("Elsie")])

4.True

获取所有标签

print(soup.find_all(name=True))

获取所有有id的a标签

print(soup.find_all(name="a", attrs={"id": True}))

# 获取所有有class的a标签

print(soup.find_all(name="a", attrs={"class": True}))

5.方法

def have_id_not_class(a):

# if tag.has_attr('id') and not tag.has_attr('class'):

# return tag

if a.has_attr('class') and not a.has_attr('id'):

return a

通过方法查找所有有class没id的标签

print(soup.find_all(have_id_not_class))

BeautifulSoup解析模块的更多相关文章

Python爬虫 | Beautifulsoup解析html页面
引入大多数情况下的需求,我们都会指定去使用聚焦爬虫,也就是爬取页面中指定部分的数据值,而不是整个页面的数据.因此,在聚焦爬虫中使用数据解析.所以,我们的数据爬取的流程为: 指定url 基于reque ...
浩哥解析MyBatis源码（十一）——Parsing解析模块之通用标记解析器（GenericTokenParser）与标记处理器（TokenHandler）
原创作品,可以转载,但是请标注出处地址:http://www.cnblogs.com/V1haoge/p/6724223.html 1.回顾上面的几篇解析了类型模块,在MyBatis中类型模块包含的 ...
python命令行参数解析模块argparse和docopt
http://blog.csdn.net/pipisorry/article/details/53046471 还有其他两个模块实现这一功能,getopt(等同于C语言中的getopt())和弃用的o ...
MyBatis源码解析（十一）——Parsing解析模块之通用标记解析器（GenericTokenParser）与标记处理器（TokenHandler）
原创作品,可以转载,但是请标注出处地址:http://www.cnblogs.com/V1haoge/p/6724223.html 1.回顾上面的几篇解析了类型模块,在MyBatis中类型模块包含的 ...
BeautifulSoup解析器的选择
BeautifulSoup解析器在我们使用BeautifulSoup的时候,选择怎样的解析器是至关重要的.使用不同的解析器有可能会出现不同的结果! 今天遇到一个坑,在解析某html的时候.使用htm ...
python命令行解析模块--argparse
python命令行解析模块--argparse 目录简介详解ArgumentParser方法详解add_argument方法参考文档: https://www.jianshu.com/p/aa ...
Python3.x的BeautifulSoup解析html常用函数
Python3.x的BeautifulSoup解析html常用函数 1,初始化: soup = BeautifulSoup(html) # html为html源代码字符串,type(html) == ...
Python3.x：BeautifulSoup()解析网页内容出现乱码
Python3.x:BeautifulSoup()解析网页内容出现乱码问题: start_html = requests.get(all_url, headers=Hostreferer) Beau ...
$命令行参数解析模块argparse的用法
argparse是python内置的命令行参数解析模块,可以用来为程序配置功能丰富的命令行参数,方便使用,本文总结一下其基本用法. 测试脚本把以下脚本存在argtest.py文件中: # codin ...

随机推荐

Navicat如何导出Excel格式表结构
SELECTCOLUMN_COMMENT 字段名,COLUMN_NAME code,COLUMN_TYPE 数据类型,DATA_TYPE 字段类型,CHARACTER_MAXIMUM_LENGTH 长 ...
重置Visual Studio 2017的配置
1,从命令行进入VS 2017安装目录下面的Common7\IDE文件夹. 例如,Windows 10系统中 VS 2017 企业版的默认安装目录如下: C:\Program Files (x86)\ ...
CVE-2018-8120 分析
目录 CVE-2018-8120 分析 1.实验环境 1.1.操作系统 1.2.用到的分析工具 2.假如 2.1.我想提权 2.2. 有一个处于内核空间,极少被调用的函数 2.3.R3任意修改R0地址 ...
zabbix忘记admin登录密码重置密码
问题描述: 有时候忘记admin的密码了,因为账号太多解决方案: 1.zabbix连接的是mysql数据库 [root@localhost /]# mysql -uroot -pAbc123 #-u ...
我的第一个python web开发框架（34）——后台管理系统权限设计
框架底层和接口终于改造完成了,小白再次找到老菜. 小白:老大,上次你对后台权限系统简单的讲了一下,我一点头绪都没有,现在有空完整的说一说吗? 老菜:说到权限系统,要讲明白真不容易,权限系统并不是越复杂 ...
adb.exe 安卓测试桥的使用
一.android SDK提供了几个工具 (在SDK下build-tools目录下的工具) dx.bat ----------->把java编译器编译生成的.class 文件 ,变成一个文件,让 ...
初步了解.net
一..net和C#是什么关系 .net是一个程序运行的平台,它是c#,vb,F#等程序运行的平台,为这些语言提供基础类库.公共语言运行时(CLR)等相关支持. C#是支持.net的一种编程语言..ne ...
软件设计之Deep Module（深模块）
类是不是越小越好?最近在读John Ousterhout的<A Philosophy of Software Design>,感到作者文笔流畅,书中内容具有启发性.这里摘要一部分内容,以供 ...
ThreadLocal的使用及原理分析
文章简介 ThreadLocal应该都比较熟悉,这篇文章会基于ThreadLocal的应用以及实现原理做一个全面的分析内容导航什么是ThreadLocal ThreadLocal的使用分析Thr ...
day5-python的文件操作-坚持就好
目录摘要文件处理 1.文件初识 2.文件的读操作 3.文件的写操作 4.文件的追加操作 5.文件的其他操作 6.文件的修改正式开始文件处理:写了这么多代码了,有的时候我们执行完成的结果想永久保存 ...

BeautifulSoup解析模块

简介：

使用

生成beautifulSoup对象：

常用获取方法：

五种过滤器：

BeautifulSoup解析模块的更多相关文章

随机推荐

热门专题