Python爬取三国演义章节标题和内容（bs4爬取，解决中文乱码）

import os.path

import requests

from bs4 import BeautifulSoup

if __name__ == '__main__':

    if not os.path.exists('./sanguoyanyi'):

        os.mkdir('./sanguoyanyi')

    url = 'https://www.shicimingju.com/book/sanguoyanyi.html'

    headers = {

        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/106.0.0.0 Safari/537.36'

    }

    # 获取页面内容

    # .encode('latin1').decode('utf-8-sig') 解决中文乱码

    page = requests.get(url=url, headers=headers).text.encode('latin1').decode('utf-8-sig')

    soup = BeautifulSoup(page, 'lxml')

    a_list = soup.select('.book-mulu ul li a')

    fp = open('./sanguoyanyi/sanguoyanyi.txt', 'w', encoding='utf-8')

    for a in a_list:

        # 获取章节标题

        title = a.text

        # 获取章节对应内容的url

        href = 'https://www.shicimingju.com/' + a['href']

        # 根据url获取内容页面数据

        content = requests.get(href, headers=headers)

        # 设置encoding避免爬取的时候中文乱码

        content.encoding = 'utf-8'

        content_soup = BeautifulSoup(content.text, 'lxml')

        content_data = content_soup.find('div', class_='chapter_content').text

        content_data = content_data.replace(u'&nbsp;', u'')

        fp.write(title + ':' + content_data + '\n')

        print('下载章节{0}成功'.format(title))

    fp.close()

    print("下载完成")

Python爬取三国演义章节标题和内容（bs4爬取，解决中文乱码）的更多相关文章

jpgraph 折线图--解决中文乱码的问题(标题和图例)
在jpgraph根目录中: 如Jpg\jpgraph_ttf.inc.php 中开头添加 define('CHINESE_TTF_FONT','SIMYOU.TTF'); \Jpg\jpgraph_l ...
python之MySQL MySQLdb 推荐使用姿势，解决中文乱码
0.目录 2.setup(1) 安装步骤,可以顺带安装mysql administrator和mysql query browser(2) 安装完毕,修改 my.ini(3) 重启 mysql 服务: ...
在visual studio code 中配置python以及解决中文乱码问题
安装好 visual stuido code (下面简称 “ VSC ”)后,要想使用它运行调试 python 代码还需要做一些工作以解决下列问题: 搭建 python 环境 print 打印中文出现 ...
WinForm开发浏览器，WebBrowser获取页面内容，如何解决中文乱码
WebBrowser的编码可以从文档对象中获得,将代码改为如下即可. System.IO.StreamReader getReader = new System.IO.StreamReader(thi ...
python flask 解决中文乱码
response = make_response(output_string)response.headers['Content-Type'] = 'text/plain;charset=UTF-8' ...
Python中解决中文乱码问题
乱码原因:因为你的文件声明为utf-8,并且也应该是用utf-8的编码保存的源文件.但是windows的本地默认编码是cp936,也就是gbk编码,所以在控制台直接打印utf-8的字符串当然是乱码了. ...
python生成饼图解决中文乱码
解决乱码问题乱码的原因字体的不匹配解决的方法加上引用中文字体就好了 matplotlib.rcParams['font.sans-serif'] = ['SimHei'] 代码 def sta ...
python爬取三国演义的所有章节储存到本地文件中
#爬取三国演义的全部章节 2 3 import urllib 4 import urllib.request 5 import urllib.parse 6 from lxml import etre ...
Python3：爬取新浪、网易、今日头条、UC四大网站新闻标题及内容
Python3:爬取新浪.网易.今日头条.UC四大网站新闻标题及内容以爬取相应网站的社会新闻内容为例: 一.新浪: 新浪网的新闻比较好爬取,我是用BeautifulSoup直接解析的,它并没有使用J ...
requests利用selenium,代理Ip,云打码，验证码抠图操作爬取搜狗微信公众号内容
爬取思路,爬取搜狗微信公众号内容,爬取第一层url时请求太快出现验证码,我这里用的蘑菇云代理,并在程序中我判断什么情况下是否+代理,做到合理运用代理ip.爬取第二层url时验证码出现次数更严重(和第一 ...

随机推荐

SOFAJRaft源码阅读-Netty时间轮算法的实践
SOFAJRaft的定时任务调度器是基于Netty来实现的,所以本文将会基于Netty时间轮算法,然后再结合SOFAJRaft源码进行分析. @Author:Akai-yuan @更新时间:2023/ ...
CAN2-CH32V307CAN2使用说明与CAN波特率计算方法
一.修改引脚 CH32V307CAN2的TX为PB13,RX为PB12 注意用CAN2时需要初始化CAN1的时钟. 二.配置CAN2过滤器开始的组(组号与图24-4相对应) 三.将FIFO0改为FIF ...
汉诺塔 Java && Cpp 实现
不论多少盘,都看成是两个盘在移动,只需要把上面的两个盘移动好就行. public static void hanoiTower(int num,char a,char b ,char c) { if( ...
Vue 04 谷歌浏览器配置vue开发者工具
参考链接:https://blog.csdn.net/wswq2505655377/article/details/111476799 1 插件下载由于国内打不开谷歌商店,直接从网盘下载链接:ht ...
.NET为什么推荐它作为RabbitMQ消息队列的首选开发工具
支持.Net Core(2.0及以上)/.Net Framework(4.5及以上),可以部署在Docker, Windows, Linux, Mac. RabbitMQ作为一款主流的消息队列工具早已 ...
接口介绍以及postman的基本使用
集成测试--测试接口接口测试也是在测试执行阶段做一.什么是接口软件的不同模块之间互相发送数据的一个通道二.接口的组成 1.请求URL--接口地址2.请求类型 get get请求的参数是暴露在U ...
快速上手Java开发工具Eclipse之简易手册
Eclipse下载,可以下载最新版本,文档是以2020-12R版本为例 http://www.eclipse.org/downloads/ 下载Packages即可安装Eclipse 解压安装除了 ...
01Python变量的使用
Python变量变量的定义变量:在程序运行过程中,值会发生变化的量把程序运算的中间结果临时存到内存里,以备后面的代码继续调用,这几个名字的学名就叫做"变量". 变量的作用我 ...
Vue框架：9，Vue3的用法，setup函数，ref和reactive，计算属性和监听属性，生命周期，toRefs，script setup的作用和lang，Vue后台管理模板
目录前端开发之Vue框架一.Vue3 1.Vue3创建项目 2.setup函数 3.ref和reactive 4.计算属性和监听属性 5.生命周期 6.toRefs 7.script setup的 ...
关于php imagettftext 函数错误解决问题
imagettftext 这个函数是给图片添加水印的,但是不知道为什么我用不起,直到在网上找到了答案: 是因为字体文件路径原因,相对路径可能我位置不对,该成绝对路径就没问题了! 把'Facon-2.t ...

Python爬取三国演义章节标题和内容（bs4爬取，解决中文乱码）

Python爬取三国演义章节标题和内容（bs4爬取，解决中文乱码）的更多相关文章

随机推荐

热门专题