爬虫基础之urllib库（代码演示）

# 自定义opener

from urllib.request import ProxyHandler,build_opener

from urllib.error import URLError

#设置代理

Proxy_Handler = ProxyHandler({

'http': 'http://127.o.o .1:9743',

'https': 'https://127.0 .0.1:9743'

})

opener = build_opener(Proxy_Handler)

try:

response = opener.open('http://www.baidu.com')

print(response.read().decode('utf-8'))

except URLError as e:

print(e.reason)

#获取cookie

import http.cookiejar,urllib.request

cookie = http.cookiejar.CookieJar()

handler = urllib.request.HTTPCookieProcessor(cookie)

opener = urllib.request.build_opener(handler)

response = opener.open('http://www.baidu.com')

for item in cookie:

print(item.name +'='+item.value)

#处理异常

URLError

from urllib import request,error

#打开一个不存在的网页

try:

respense = request.urlopen( 'https://cuiqingcai.com/index.htm')

except error.URLError as e:

print(e.reason)

#reason ：同父类一样，用于返回错误的原因

因为 URLError 是 HTTP Error 的父类，所以可以先选择捕获子类的错误，再去捕获父类的错误，所
以上述代码更好的写法如下：
from urllib import request, error
try:
response = request.urlopen(’ https://cuiqingcai.com/index.htm’)
except error.HTTPError as e:
print(e.reason, e.code, e.headers, sep=’\n’)
except error.URLError as e:
print(e . reason)
else:
print(’ Request Successfully')
这样就可以做到先捕获 HTTP Error ，获取它的错误状态码、原因、 headers 等信息。如果不是
HTTP Error 异常，就会捕获 URLError 异常，输出错误原因。最后，用 else 来处理正常的逻辑。这是一
个较好的异常处理写法。
有时候， reason 属性返回的不一定是字符串，也可能是一个对象。再看下面的实例：
import socket
import urllib.request
import urllib .error
try:
response = urllib.request.urlopen(’ https://WvM.baidu.com’, tim
except l」rllib . err口r.URLError as e:
print(type(e.reason))
if isinstance(e .reason, socket .tir陀out):
print(' TIME OUT')
这里我们直接设置超时时间来强制抛出 timeout 异常。
运行结果如下：
<class ’ socket .timeout ’>
TIME OUT
可以发现， reason 属性的结果是 socket.timeout 类。所以，这里我们可以用 is instance （）方法来
判断它的类型，作出更详细的异常判断。

#urlparse（）该函数实现url识别与分段

from urllib.parse import urlparse

res = urlparse('https://i.cnblogs.com/EditPosts.aspx?postid=9531564')

print(type(res), res)

结果：

<class 'urllib.parse.ParseResult'> ParseResult(scheme='https', netloc='i.cnblogs.com', path='/EditPosts.aspx', params='', query='postid=9531564', fragment='')

from urllib import parse

params = {

'name':'123',

'age':22

}

url = 'http://www.baidu.com?'

n_url = url + parse.urlencode(params)

print(n_url)

结果http://www.baidu.com?name=123&age=22

这个方法非常常用。有时为了更加方便地构造参数，我们会事先用字典来表示。要转化为 URL
的参数时，只需要调用该方法即可。

# quote()
该方法可以将内容转化为 URL 编码的格式。 URL 中带有中文参数时，有时可能会导致乱码的问
题，此时用这个方法可以将巾文字符转化为 URL 编码，示例如下：
from urllib.parse import quote
keyword ＝’壁纸’
url =’ https://www.baidu.com/s?wd=’+ quote(keyword)
print(url)
这里我们声明了一个中文的搜索文字，然后用 quote （）方法对其进行 URL 编码，最后得到的结果
如下：
https://www.baidu.com/s?wd＝%81%E7%BA%B8

#有了 quote （）方法，当然还有 unquote （）方法，它可以进行 URL 解码，示例如下：

from urllib.parse import unquote

url = 'http://www.baidu.com/s?wd=%E5%A3%81%E7%BA%B'

print(unquote(url))

爬虫基础之urllib库（代码演示）的更多相关文章

爬虫基础(1):urllib库
urllib库 urllib库是python中的一个基本网络请求库.用于模拟浏览器的行为,向指定服务器发送请求,并接收返回的数据. 在python3中所有的网络请求相关函数都集中在urllib.req ...
爬虫基础之urllib库
urllib库的基本使用 urlopen() # 导入urllib库 import urllib # 往指定url发送请求,返回一个响应对象 response = urllib.request.url ...
第三百三十六节，web爬虫讲解2—urllib库中使用xpath表达式—BeautifulSoup基础
第三百三十六节,web爬虫讲解2—urllib库中使用xpath表达式—BeautifulSoup基础在urllib中,我们一样可以使用xpath表达式进行信息提取,此时,你需要首先安装lxml模块 ...
第三百二十七节，web爬虫讲解2—urllib库爬虫—基础使用—超时设置—自动模拟http请求
第三百二十七节,web爬虫讲解2—urllib库爬虫利用python系统自带的urllib库写简单爬虫 urlopen()获取一个URL的html源码read()读出html源码内容decode(& ...
python 3.x 爬虫基础---常用第三方库（requests，BeautifulSoup4，selenium，lxml ）
python 3.x 爬虫基础 python 3.x 爬虫基础---http headers详解 python 3.x 爬虫基础---Urllib详解 python 3.x 爬虫基础---常用第三方库 ...
第三百三十节，web爬虫讲解2—urllib库爬虫—实战爬取搜狗微信公众号—抓包软件安装Fiddler4讲解
第三百三十节,web爬虫讲解2—urllib库爬虫—实战爬取搜狗微信公众号—抓包软件安装Fiddler4讲解封装模块 #!/usr/bin/env python # -*- coding: utf- ...
第三百二十九节，web爬虫讲解2—urllib库爬虫—ip代理—用户代理和ip代理结合应用
第三百二十九节,web爬虫讲解2—urllib库爬虫—ip代理使用IP代理 ProxyHandler()格式化IP,第一个参数,请求目标可能是http或者https,对应设置build_opener ...
第三百二十八节，web爬虫讲解2—urllib库爬虫—状态吗—异常处理—浏览器伪装技术、设置用户代理
第三百二十八节,web爬虫讲解2—urllib库爬虫—状态吗—异常处理—浏览器伪装技术.设置用户代理如果爬虫没有异常处理,那么爬行中一旦出现错误,程序将崩溃停止工作,有异常处理即使出现错误也能继续执 ...
爬虫入门之urllib库详解(二)
爬虫入门之urllib库详解(二) 1 urllib模块 urllib模块是一个运用于URL的包 urllib.request用于访问和读取URLS urllib.error包括了所有urllib.r ...

随机推荐

解决libVLC无法响应鼠标消息
参考: https://blog.jianchihu.net/player-based-on-libvlc.html 自己在Qt上的实现: 头文件 libvlc_instance_t * m_inst ...
python - 列表，元组
1.列表定义:能装对象的对象在python中使用[] 来描述列表,内部元素用逗号隔开,对数据类型没有要求. 列表存在索引和切片,和字符串的操作是一样的 2.列表相关 ...
3DsMax 自动化操作（maxScript）
这是我编写的一部分maxScript 脚本,专注于3DsMax 快速建模,程序化地为我们完成一些繁琐的工作. 可以极大提高公司开发的效率! 2019年04月09日 :上传今年新开发的插件,还有很多, ...
jenkins log文件突然占满磁盘空间
今天早上同事反应jenkins构建job发生异常,于是登录机器查看发现磁盘空间已满.进一步排查之后发现jenkins的catalina.out文件已占满磁盘空间. 用tail看了下日志后面都是关于DN ...
python输入字符串
#!/usr/bin/env python#ecoding=utf-8'''Created on 2017年11月2日题目:利用递归函数调用方式,将所输入的5个字符,以相反顺序打印出来. @autho ...
基于DES加密的服务端分析
此程序建立了一个TCP服务端,端口号为10010,之后accept等待连接,如果接受到连接,那么就发送一些欢迎信息,以及提示信息---发送quit退出. 之后不停地调用recv,如果接受到数据,那么判 ...
cocoapod终端配置
linux目录说明
/etc/passwd 用户信息文件 [root@web01 ~]# cat /etc/passwd root: x: : : root: /root: /bin/bash 可登录用户 bin: x ...
Android软键盘的隐藏显示、事件监听的代码
把开发过程中重要的一些内容片段做个珍藏,如下资料是关于Android软键盘的隐藏显示.事件监听的内容,应该是对小伙伴们有所用途. public class ResizeLayout extends L ...
SSM excel文件的导入导出
对于excel文件的导入导出,后台接收读取和建表封存都是固定死的,所以对于excel导入时,excel文件内容必须匹配后台相关对象,不然报错. excel文件导出,用<a><a/&g ...

爬虫基础之urllib库（代码演示）

爬虫基础之urllib库（代码演示）的更多相关文章

随机推荐

热门专题