UnicodeEncodeError: ‘gbk’ codec can’t encode character u’\u200e’ in position 43: illegal multib

【问题】

在执行代码时，提示上述错误，源码如下：

 # 下载小说...

 def download_stoy(crawl_list,header):

     # 创建文件流，将各个章节读入内存

     with open('E:\盗墓test22.txt', 'w') as f:

         for each_url in crawl_list:

             # 有的时候访问某个网页会一直得不到响应，程序就会卡到那里，我让他0.6秒后自动超时而抛出异常

             while True:

                 try:

                     request = urllib.request.Request(url=each_url, headers=header)

                     with urllib.request.urlopen(request, timeout=0.6) as response:

                         html = response.read().decode('utf-8')

                         break

                 except:

                     # 对于抓取到的异常，让程序停止1.1秒，再循环重新访问这个链接，访问成功时退出循环

                     time.sleep(1.1)

             # 匹配文章标题

             title_req = re.compile(r'<h1>(.+?)</h1>')

             # 匹配文章内容，内容中有换行，所以使flags=re.S  re.S表示跨行匹配

             #content_req = re.compile(r'<div class ="content-body">(.+)</div>', re.S)

             content_req = re.compile(r'<p>(.*?)</p>', re.S)

             #"<div[^>]+>.+?<div>(.+?)</div></div>", re.I

             #content_req = re.compile(r'<div[^>]+>.+?<div>(.+?)</div></div>', re.S)

             # 获取标题

             title = title_req.findall(html)[0]

             # 获取内容

             content_test = content_req.findall(html)

             print('抓取章节>' + title)

             f.write(title + '\n')

             #print(content_test)

             for each in content_test:

                 # 筛除不需要的的html元素

                 str1 = each.replace('&ldquo;', ' ')

                 str2 = str1.replace('&hellip;', ' ')

                 str3 = str2.replace('&rdquo;',' ')

                 f.write(str3 + '\n')

【解决过程】

1. 再次确认其编码格式，确实是utf-8；

2.此问题觉得很诡异的是，本身调用UTF-8去decode，但是解码出错却提示的是GBK的，而不是UTF-8相关解码出错。

3.找了其他帖子，尝试在解码时添加ignore 属性，但没有解决。文中提供的第二种解释，直觉不是这个原因。继续找其他帖子。

https://www.crifan.com/unicodeencodeerror_gbk_codec_can_not_encode_character_in_position_illegal_multibyte_sequence/

4.又找到一个，

http://www.jb51.net/article/64816.htm

根据提示，在文件打开时添加 encoding='utf-8'，即，

    with open('E:\盗墓test22.txt', 'w',encoding='utf-8') as f:

问题解决。

【参考】

【总结】Python 2.x中常见字符编码和解码方面的错误及其解决办法

UnicodeEncodeError: ‘gbk’ codec can’t encode character u’\u200e’ in position 43: illegal multib的更多相关文章

UnicodeEncodeError: ‘gbk’ codec can’t encode character u’\u200e’ in position 43: illegal multibyte sequence
[问题] python中已获取网页: http://blog.csdn.net/hfahe/article/details/5494895 的html源码,其时UTF-8编码的. 提取出其标题部分: ...
解决“UnicodeEncodeError: 'gbk' codec can't encode character u'\xa9' in position 24051: illegal multibyte sequence”错误
今天我在爬取一个网页时出现了下面这个错误: UnicodeEncodeError: 'gbk' codec can't encode character u'\xa9' in position 240 ...
解决UnicodeEncodeError: 'gbk' codec can't encode character u'\u25aa' in position 344 : illegal multiby
Python拿来做爬虫的确很不错,但是字符串的编码的确是稍不留神就是一个坑,GBK编码和Unicode编码的转化出现问题也是很多的,今天在解析网页数据的时候出现上述错误,解决方案如下: one_str ...
Python读取中文txt文件错误：UnicodeEncodeError: 'gbk' codec can't encode character
with open(file,'r') as f: line=f.readline() i=1 while line: line=line.decode('utf-8') line=f.readlin ...
解决python3 UnicodeEncodeError: 'gbk' codec can't encode character '\xXX' in position XX
从网上抓了一些字节流,想打印出来结果发生了一下错误: UnicodeEncodeError: 'gbk' codec can't encode character '\xbb' in position ...
UnicodeEncodeError: 'gbk' codec can't encode character '\xa0' in position 1987: illegal multibyte sequence
在爬取 url = "http://stats.meizhou.gov.cn/show/index/1543/1689" 时出现了问题: UnicodeEncodeError: ' ...
[转]Python UnicodeEncodeError: 'gbk' codec can't encode character 解决方法
使用Python写文件的时候,或者将网络数据流写入到本地文件的时候,大部分情况下会遇到:UnicodeEncodeError: 'gbk' codec can't encode character ' ...
UnicodeEncodeError: 'gbk' codec can't encode character '\xbb' in position 30633: illegal multibyte sequence
import urllib.request def load_baidu(): url = "https://www.baidu.com/" header = {"Use ...
[python]UnicodeEncodeError: 'gbk' codec can't encode character '\ufffd'
有关编码问题,一直以来都是十分头疼的问题.代码中的字符编码其实还好,但是由于使用的window系统,会用Window的默认编码去解析文本. 今天用脚本在写文件的时候,就总是弹出UnicodeEncod ...

随机推荐

AutoCAD 导入 Altium Designer 10 教程
http://www.geek-workshop.com/thread-5478-1-1.html
命令行模式启动VMWare虚拟机
工作中使用到在centos中安装vmware Workstation部署虚拟机,以前都是使用图形界面启动虚拟机,由此要调整VNC的分辨率大小,重启VNC Server后所有虚拟机都关闭了.事后分析可能 ...
(笔记)Linux Socket通信：bind: Address already in use
在网络通信时使用Bind绑定IP地址跟端口号时,有时Ctrl+C强制结束进程之后,再次运行程序Bind错误,原因如下: 虽然用Ctrl+C强制结束了进程,但错误依然存在,用netstat -an |g ...
JUnit断言
在本节中,我们将介绍一些断言方法.所有这些方法都受到 Assert 类扩展了java.lang.Object类并为它们提供编写测试,以便检测故障.下表中有一种最常用的断言方法的更详细的解释. 断言描 ...
(转)关于C++ const 的全面总结
转自:http://blog.csdn.net/Eric_Jo/article/details/4138548 C++中的const关键字的用法非常灵活,而使用const将大大改善程序的健壮性,本人根 ...
RNA_seq GATK 最佳实践
GATK处理DNA 水平的snp 经验比较成熟,而RNA 水平较少,所以可能会存在错误目前的流程兼顾了假阳性(不是真的snp位点)和假阴性(该位点是snp,却没有检测到):后续会不断改善 G ...
C# 指定ip段生成ip地址
private void button1_Click(object sender, EventArgs e) { string StartIp = ""; string EndIp ...
USBWebServer 中文便携版快速搭建 PHP/MySQL 网站服务器环境
如果你是一位 WEB 开发者,或正在学习网页编程,你一定会发现,每到一台新电脑上想要在本地调试测试/运行网站代码都得搭建配置一遍 WAMP (Win.Apache.PHP.MySQL) 环境简直烦透了 ...
[转]调试AngularJS应用
原文链接:Debugging AngularJS Apps from the Console 当我们开发AngularJS应用的时候,我们想在Chrome/FF/IE控制台调试隐藏在应用中的数据和服务 ...
Thinkphp5笔记九：路由设置，隐藏indx.php
网站根目录下.htaccess <IfModule mod_rewrite.c> Options +FollowSymlinks -Multiviews RewriteEngine on ...

UnicodeEncodeError: ‘gbk’ codec can’t encode character u’\u200e’ in position 43: illegal multib

UnicodeEncodeError: ‘gbk’ codec can’t encode character u’\u200e’ in position 43: illegal multib的更多相关文章

随机推荐

热门专题