01-urllib库添加headers的一般方法

2018-08-23 13:07:57

对于请求一些网站，我们需要加上请求头才可以完成网页的抓取，不然会得到一些错误，无法返回抓取的网页。下面，介绍两种添加请求头的方法。

方法一：借助build_opener和addheaders完成

 import urllib.request

 url="http://www.meizitu.com"

 #注意：在urllib 中headers是元组

 headers=("User-Agent","Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36 QIHU 360SE")

 opener=urllib.request.build_opener()

 opener.addheaders=[headers]

 data=opener.open(url)

 print(data.read())

注意：此处的headers要写为一个元组类型才可以。写为字典类型的话会报错！

方法二、创建一个Request实例对象

 # 案例1

 import urllib.request

 url="http://www.meizitu.com"

 #注意：在urllib 中这种的headers 是需要是字典的

 headers={"User-Agent":"Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36 QIHU 360SE"}

 req=urllib.request.Request(url=url,headers=headers)

 file=urllib.request.urlopen(req)

 #出现有些解码错误的话，加上“ignore”就可以啦

 print(file.read().decode("utf-8",'ignore'))

注意：此处的headers要写为一个字典类型才可以。
创建一个Reques对象，把需要的headers,url，proxy 都放进去，或者在post 请求中还可以把编码过后的data 值放进去，再用urlopen 打开，就比较方便了。

另外，这种方法还可以用add_headers（）来添加headers，代码如下：

 import urllib.request

 try:

     url="http://www.meizitu.com"

     req=urllib.request.Request(url=url)

     req.add_header("User-Agent","Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36 QIHU 360SE")

     file=urllib.request.urlopen(req,timeout=10.1)

     print(file.read().decode("utf-8",'ignore'))

 except Exception as e:

     print("时间超时",str(e))

总结：通过以上两种方法，可以完成请求头的相关参数设置，但是得注意headers是用字典类型来传入还是元组类型。

01-urllib库添加headers的一般方法的更多相关文章

urllib库使用方法
这周打算把学过的内容重新总结一下,便于以后翻阅查找资料. urllib库是python的内置库,不需要单独下载.其主要分为四个模块: 1.urllib.request——请求模块 2.urllib.e ...
客户端ajax请求为实现Token验证添加headers后导致正常请求变为options跨域请求解决方法
客户端为了实现token认证,通过Jquery的ajaxSetup方法全局配置headers: 全局配置headers后会导致部分不需要token认证的请求变为options请求,导致跨域访问.报错信 ...
Python爬虫学习==>第七章：urllib库的基本使用方法
学习目的: urllib提供了url解析函数,所以需要学习正式步骤 Step1:什么是urllib urllib库是Python自带模块,是Python内置的HTTP请求库包含4个模块: >& ...
urllib库使用方法 3 get html
import urllib.requestimport urllib.parse #https://www.baidu.com/s?ie=UTF-8&wd=中国#将上面的中国部分内容,可以动态 ...
爬虫之urllib库
一.urllib库简介简介 Urllib是Python内置的HTTP请求库.其主要作用就是可以通过代码模拟浏览器发送请求.它包含四个模块: urllib.request :请求模块 urllib.e ...
Python3中Urllib库基本使用
什么是Urllib? Python内置的HTTP请求库 urllib.request 请求模块 urllib.error 异常处理模块 urllib.par ...
爬虫学习--Urllib库基本使用 Day1
一.Urllib库详解 1.什么是Urllib Python内置的HTTP请求库 urllib.request 请求模块(模拟实现传入网址访问) urllib.error ...
爬虫（二）：Urllib库详解
什么是Urllib: python内置的HTTP请求库 urllib.request : 请求模块 urllib.error : 异常处理模块 urllib.parse: url解析模块 urllib ...
python爬虫 - Urllib库及cookie的使用
http://blog.csdn.net/pipisorry/article/details/47905781 lz提示一点,python3中urllib包括了py2中的urllib+urllib2. ...

随机推荐

美赛LaTeX急救指南
目录 1 关于easymcm宏包的基本信息,以及编译系统的若干问题 2 图片.表格.数学公式.网址的处理 3 样式.字体字号.段落的设置 4 目录.交叉引用的相关问题关于标题不能换行的问题:这里有解 ...
CocoaPods管理第三方
之前听伟哥说用CocoaPods做第三方库的管理很方便,今天看了下自己做了下感觉确实不错.下面开始,Let's go!! 1.安装CocoaPods之前,先确保本地有Ruby环境,因为CocoaPod ...
IBatis项目中com.ibatis.common.xml.NodeletException的解决方案
一现象: 今天在写IBatis项目是总是提示我有如下异常: com.ibatis.common.xml.NodeletException java.util.NoSuchElementExcepti ...
wcf远程服务器返回错误404
最近根据quartz.net 和wcf做资讯内容定时推送,wcf调用的时候出现远程服务器返回错误404,一直找不到原因是什么,客户端和服务器地址和配置都没啥问题,最后发现wcf请求数据,有传输大小限制 ...
Oracle中的锁
Oracle中的锁锁是一种机制,多个事务同时访问一个数据库对象时,该机制可以实现对并发的控制按照用户系统锁可以分为自动锁和显示锁. 自动锁(系统上锁):DML锁.DDL锁.systemlocks锁 ...
PHPCMS V9标签循环嵌套调用数据的方法
PHPCMS V9的标签制作以灵活见长,可以自由DIY出个性的数据调用,对于制作有风格有创意的网站模板很好用,今天就介绍一个标签循环嵌套方法,可以实现对PC标签循环调用,代码如下: 在此文件里/php ...
cf121C. Lucky Permutation(康托展开)
题意题目链接 Sol 由于阶乘的数量增长非常迅速,而\(k\)又非常小,那么显然最后的序列只有最后几位会发生改变. 前面的位置都是\(i = a[i]\).那么前面的可以直接数位dp/爆搜,后面的部 ...
ThreeJS两个点作为起始坐标画一个立方体
drawLineBox(new THREE.Vector3(100, 50, 0), new THREE.Vector3(200, 100, 100)); function drawLineBox(s ...
C# Visual 快捷键
编辑系代码提示 Ctrl + J激活VS默认代码提示功能.ReSharper等插件会建议你修改快捷键. 导入命名空间个人认为Ctrl + .是最方便的,复杂点的是Alt + Shift + F ...
Keras GlobalAveragePooling2D 示例代码
GlobalAveragePooling2D层 keras.layers.pooling.GlobalAveragePooling2D(dim_ordering=‘default‘) 为空域信号施加全 ...

01-urllib库添加headers的一般方法

01-urllib库添加headers的一般方法的更多相关文章

随机推荐

热门专题