爬虫之Beautifulsoup的基本实用

基本方法如下:

# soup.a 只能找到第一个符合要求的标签

# soup.a.attrs 获取a所有的属性和属性值

# soup.a.attrs['href'] 获取href属性

# soup.a.string 获取a标签中存储的文本内容(直系)

# soup.a.text # 非直系 该标签下所有的文本内容

# soup.a.get_text() # 非直系 该标签下所有的文本内容

# soup.find('a') 找到第一个符合要求的标签

# soup.find('a', id='xxx') id为xxx的的a标签(返回一个)

# soup.findall('a') # 找到所有a标签

# soup.findall(['a', 'b']) # 找到所有a标签和b标签

# soup.select() # 根据选择器选择定位到标签

简单案例: 下载诗词名句网的三国演义文章

import requests

from bs4 import BeautifulSoup

url = 'http://www.shicimingju.com/book/sanguoyanyi.html'

fileTxt = requests.get(url).text

soup = BeautifulSoup(fileTxt, 'lxml')

a_list = soup.select('.book-mulu > ul > li > a')

f = open('sanguo.txt', 'w', encoding='utf8')

for a in a_list:

    title = a.string

    detail_url = 'http://www.shicimingju.com' + a['href']

    text = requests.get(detail_url).text

    detail_soup = BeautifulSoup(text, 'lxml')

    content = detail_soup.find('div', class_='chapter_content').text

    f.write(title+'\n'+content)

    print(f'{title} 下载完毕')

print('over')

f.close()

爬虫之Beautifulsoup的基本实用的更多相关文章

爬虫模块BeautifulSoup
中文文档:https://www.crummy.com/software/BeautifulSoup/bs4/doc/index.zh.html# 1.1 安装BeautifulSoup模块 ...
使用Python爬虫库BeautifulSoup遍历文档树并对标签进行操作详解（新手必学）
为大家介绍下Python爬虫库BeautifulSoup遍历文档树并对标签进行操作的详细方法与函数下面就是使用Python爬虫库BeautifulSoup对文档树进行遍历并对标签进行操作的实例,都是最 ...
Python开发爬虫之BeautifulSoup解析网页篇：爬取安居客网站上北京二手房数据
目标:爬取安居客网站上前10页北京二手房的数据,包括二手房源的名称.价格.几室几厅.大小.建造年份.联系人.地址.标签等. 网址为:https://beijing.anjuke.com/sale/ B ...
Python 爬虫—— requests BeautifulSoup
本文记录下用来爬虫主要使用的两个库.第一个是requests,用这个库能很方便的下载网页,不用标准库里面各种urllib:第二个BeautifulSoup用来解析网页,不然自己用正则的话很烦. req ...
python爬虫之BeautifulSoup
爬虫有时候写正则表达式会有假死现象就是正则表达式一直在进行死循环查找例如:https://social.msdn.microsoft.com/forums/azure/en-us/3f4390ac ...
web爬虫，BeautifulSoup
BeautifulSoup 该模块用于接收一个HTML或XML字符串,然后将其进行格式化,之后遍可以使用他提供的方法进行快速查找指定元素,从而使得在HTML或XML中查找指定元素变得简单. 1 2 3 ...
python 爬虫 requests+BeautifulSoup 爬取巨潮资讯公司概况代码实例
第一次写一个算是比较完整的爬虫,自我感觉极差啊,代码low,效率差,也没有保存到本地文件或者数据库,强行使用了一波多线程导致数据顺序发生了变化... 贴在这里,引以为戒吧. # -*- coding: ...
Python爬虫——用BeautifulSoup、python-docx爬取廖雪峰大大的教程为word文档
版权声明:本文为博主原创文章,欢迎转载,并请注明出处.联系方式:460356155@qq.com 廖雪峰大大贡献的教程写的不错,写了个爬虫把教程保存为word文件,供大家方便下载学习:http://p ...
python3: 爬虫---- urllib, beautifulsoup
最近晚上学习爬虫,首先从基本的开始: python3 将urllib,urllib2集成到urllib中了, urllib可以对指定的网页进行请求下载, beautifulsoup 可以从杂乱的ht ...

随机推荐

windows下webpack不是内部命令解决方法
安装webpack 到打包文件一路出现的各种问题 windows下webpack不是内部命令安装完webpack后要加下环境变量系统变量新建 NODE_PATH 变量值E:\demo\webpac ...
移动端尺寸新写法-rem
rem这是个低调的css单位,近一两年开始崭露头角,有许多同学对rem的评价不一,有的在尝试使用,有的在使用过程中遇到坑就弃用了.但是我对rem综合评价是用来做web app它绝对是最合适的人选之一. ...
CF1063F. String Journey（后缀数组＋线段树）
题目链接 https://codeforces.com/contest/1063/problem/F 题解虽然本题有时间复杂度较高但非常好写的做法...... 首先,若答案为 \(k\),则一定存在 ...
[转] Vagrant入门
[From] https://www.cnblogs.com/davenkin/p/vagrant-virtualbox.html 简单地说,Vagrant让我们可以通过代码的方式快速地.可重复地创建 ...
01背包--hdu2639
hdu-2639 The title of this problem is familiar,isn't it?yeah,if you had took part in the "Rooki ...
20190430-Bootstrapの组件
写在前面的乱七八糟:今天务必要把BT盘完~任重道远~ 目录 1.字体图标 2.下拉菜单 3.按钮组 4.输入框组 5.导航 5.1标签页 5.2胶囊式标签页 5.3路径导航/面包屑导航 6.导航条 7 ...
Java_break与continue区别
使用场合不同 break:可以在switch case中使用,也可以在循环中使用 continue:只能在循环中使用,除了switch case 作用不同 break:表示中断,当在switch ...
《数据密集型应用系统设计》读书笔记-ch1可靠、可扩展与可维护的应用系统
我们以Twitter为例,使用其2012年11月发布的数据.Twitter的两个典型业务操作是: - 发布tweet消息: 用户可以快速推送新消息到所有的关注者,平均大约4.6k request/se ...
Python+selenium实现登录脚本
import unittestfrom selenium import webdriverfrom time import sleepclass LoginCase(unittest.TestCase ...
关于chart不能自行切换出现的报错现象
1.echart 页面菜单不能切换,line和bar不能自行切换页面上报错误 bar has not been reqired 解决办法,加载bar <script type=" ...

爬虫之Beautifulsoup的基本实用

爬虫之Beautifulsoup的基本实用的更多相关文章

随机推荐

热门专题