Python学习——BeautifulSoup篇

BeautifulSoup

Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式.Beautiful Soup会帮你节省数小时甚至数天的工作时间.

在本节的笔记中，笔者将会分享两次示例，来帮助大家熟悉BeautifulSoup库的使用，好的，闲话不说，我们来看一下示例。

如何去定位元素

下面我们来爬取一个网页，然后提取里面一些简单的数据

import requests

from bs4 import BeautifulSoup as bs

url = "http://china.huanqiu.com/article/2016-07/9132061.html?from=bdwz"

response = bs(requests.get(url).content,'html.parser')

#获取页面内，h1标签的文章标题

print("这篇文章的标题是：",response.h1.string)

#使用find方法，寻找页面内name=source的content的内容

print ("这篇文章的类型是：",response.find(attrs= {'name':'source'})['content'])

#从find_all返回的列表中，查找content字段

for content in response.find_all('meta',{'name':'source'}):

print("这篇文章的类型是：",content['content'])

我们来解读一下上面这段代码：

1、导入requests库

2、导入BeautifulSoup库的bs4方法命名为bs

3、将目标地址赋予url

4、使用bs对爬取到的web页面的二进制数据进行html的解析

（这里使用的是requests.get().content返回的是爬取到的页面的二进制数据，之前我也是用的requests.get().text，但是会有乱码，具体原因不是很清楚。不过有前辈讲是因为requests.get().text 是将爬取到的内容进行默认的转译，而win的系统总是会出莫名其妙的问题）

5、打印，爬取到的页面中的h1标签的页面标题（页面标签麻烦自行百度html页面标签）

6、使用find方法，搜索爬取到的内容里，name=source的内容，打印content对应的数据

7、从find_all返回的列表中，寻找name=source的content字段的数据并打印。

（之前我是有尝试过使用find_all这个方法的，但是没有成功，因为我忽略了find_all方法返回的实际上是一个列表）

Python学习——BeautifulSoup篇的更多相关文章

Python学习第一篇
好久没有来博客园了,今天开始写自己学习Python和Hadoop的学习笔记吧.今天写第一篇,Python学习,其他的环境部署都不说了,可以参考其他的博客. 今天根据MachineLearning里面的 ...
[Python学习]错误篇二：切换当前工作目录时出错——FileNotFoundError: [WinError 3] 系统找不到指定的路径
REFERENCE:<Head First Python> ID:我的第二篇[Python学习] BIRTHDAY:2019.7.13 EXPERIENCE_SHARING:解决切换当前工 ...
[Python学习]错误篇一
REFERENCE:<Head First Python> ID:我的第一篇[Python学习] BIRTHDAY:2019.7.6 EXPERIENCE_SHARING:两个程序错误类型 ...
Python学习—基础篇之文件操作
文件操作文件操作也是编程中需要熟练掌握的技能,尤其是在后台接口编写和数据分析过程中,对各种类型的文件进行操作,获取文件信息或者对信息进行存储是十分重要的.本篇博客中将主要对常见的文本格式文件和Exc ...
Python学习 - 入门篇2（更新中）
前言学习渠道:慕课网:Python进阶记录原因:我只是想边上课边做笔记而已,呵呵哒食用提示:教程环境基于Python 2.x,有些内容在Python 3.x中已经改变函数式编程定义:一种抽象 ...
Python学习 - 入门篇1
前言学习渠道:慕课网:Python入门记录原因:人总归要向记忆低头[微笑再见.gif] 记录目标:形成简洁的知识点查阅手册变量和数据类型变量赋值在Python中,可以把任意数据类型赋值给变 ...
Python ( 学习基础篇第一部 )
目录注释注释的分类注释的注意点变量变量的概念变量的声明变量的命名变量的交换变量的缓存机制常量进制进制的转换原码反码补码六大数据类型 Number 的四大类字符串 st ...
python学习总结篇（2）——函数
如其他语言一样,除了基本知识外,另外一个重要的板块就是函数了,python中也有函数. 在python中,函数的定义方式为: def 函数名( ): 下面通过几个简单的例子,看看python中的函 ...
Python学习——基础篇
1.python的安装 python下载地址:https://www.python.org/downloads/ 安装完成后,运行cmd.exe,输入python 如果出现“p ...

随机推荐

java学习笔记5——String类常用方法
1.字符串长度计算: int i = String1.length(); 2.字符串比较:1) equals()和equalsIgnoreCase //比较两个字符串对象的实体是否相同,相同输出tru ...
检索源码删除无用Properties的小工具
背景: 重新做项目的过程中,引用了大量旧代码.尤其是Properties文件,里面肯定有一批是无用的,干脆笨办法直接扫描源码文件来过滤. 后续在此基础上修改修改,再做个扫描无用image文件的类. 代 ...
Brain Network (hard) CodeForces - 690C 简单倍增 + 一些有趣的推导
Code: #include<cstdio> #include<cstring> #include<algorithm> using namespace std; ...
echart全局属性，自用，搜索比较快
// 全图默认背景 // backgroundColor: ‘rgba(0,0,0,0)’, // 默认色板 color: ['#ff7f50','#87cefa','#da70d6','#32cd ...
3.3、Ansible命令参数详解
0.ansible 命令参数详解: [root@localhost ~]# ansible Usage: ansible <host-pattern> [options] Options: ...
Untiy中的数据平滑处理
本文章由cartzhang编写,转载请注明出处. 所有权利保留. 文章链接:http://blog.csdn.net/cartzhang/article/details/50680237 作者:car ...
some untracked working tree files问题解决
我使用的是idea,情境是在使用git同步代码的时候,出现的错误. 我这里报错是在右上角的显示信息,其中有一个show view的可点击连接我点击之后将上面展示的文件删除之后重新同步代码,成功.
【Codeforces Round #507 (Div. 2, based on Olympiad of Metropolises) A】Palindrome Dance
[链接] 我是链接,点我呀:) [题意] 在这里输入题意 [题解] i从1..n/2循环一波. 保证a[i]和a[n-i+1]就好. 如果都是2的话填上min(a,b)*2就好其他情况跟随非2的. ...
[SharePoint][SharePoint Designer 入门经典]Chapter8 XSLT数据试图和表单
本章概要: 1.不是利用XSLT web部件 2.使用XSLT web部件创建数据试图 3.使用XSLT表单web部件创建自定义表单 4.利用自定义动作执行列表表单
NEFU 109
n最大为2000000000(不知为什么OJ上是1000),若为判断2000000000是素数,则必有一个素数在sqrt(n)内,求出这个范围的所有素数,其比最大数据小的n'的sqrt(n')也在这 ...

Python学习——BeautifulSoup篇

Python学习——BeautifulSoup篇的更多相关文章

随机推荐

热门专题