python urllib.request

一、简介

urllib.request 模块提供了访问 URL 的相关功能

二、常用函数

urllib.request.urlopen("http://httpbin.org", timeout=1)

// 访问网页，并设置1秒的超时时间（urlopen 只能实现最基本的请求）

读：

.read() // 读取网页（二进制）
.decode('utf-8') // 以 utf-8 解码网页
.geturl() // 获取访问的 URL

信息：

.info() // 获取网响应页的 Headers 信息
.headers // 获取网页响应的 Headers 信息
.getheaders() // 获取网页响应的 Headers 信息（以列表形式返回）
.getheader(name="Content-Type") // 获取网页响应的 Headers 信息（查看指定的属性）
.version // 查看 HTTP 使用的版本协议号

状态码：

.getcode() // 获取当前访问的状态码
.status // 获取当前访问的状态码
.reason // 获取当前访问的状态码（如访问成功则返回 OK）

urllib.request.Request(url=url, data=data, headers=header, method="POST")

.add_header // 添加新的 Header（接受元组类型）

参数	作用
url	需请求的 url
data	必须为 bytes（字节流）类型，如为字典，可用 urllib.parse.urlencode()
headers	请求头
origin_req_host	指定请求方的 host 名称或 ip 地址
unverifiable	设置网页是否需要验证（默认为 Flase）
method	指定请求方法（如：GET、POST等）

三、实例

1、读取网页，并以 utf-8 格式解码

#  读取网页，并以 utf-8 格式解码

urllib.request.urlopen("http://httpbin.org").read().decode('utf-8')

2、获取访问的 URL

#  获取访问的 URL

urllib.request.urlopen("http://httpbin.org").geturl()

3、获取 Headers 信息

#  获取 Headers 信息

urllib.request.urlopen("http://httpbin.org").info()

4、获取访问的状态码

#  获取访问的状态码

urllib.request.urlopen("http://httpbin.org").getcode()

5、指定 Headers 访问网页

import urllib.request

#  指定访问的 URL

url = "http://httpbin.org/get"

#  指定访问的 Headers

header = {

    "Host": "httpbin.org",

    "Referer": "http://httpbin.org/",

    "User-Agent": "Mozilla/5.0 (Windows NT 99.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.83 Safari/537.36",

}

#  使用指定的 Headers 访问网页

test = urllib.request.Request(url=url, headers=header)

#  以 utf-8 的格式打印出访问的页面

test_2 = urllib.request.urlopen(test).read().decode("utf-8")

print (test_2)

6、发送带参数的 GET 请求

import urllib.request

import urllib.parse

#  指定访问的 URL

url = "http://httpbin.org/get"

#  指定访问的 Headers

header = {

    "Host": "httpbin.org",

    "Referer": "http://httpbin.org/",

    "User-Agent": "Mozilla/5.0 (Windows NT 99.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.83 Safari/537.36",

}

#  设置需传递的参数（使用 urlencode 将字典转换成可提交的参数，如：a=test_1&b=test_2）

data = urllib.parse.urlencode({'a':'test_1', 'b':'test_2'})

url = url + "?" + data

#  使用指定的 Headers 访问网页

test = urllib.request.Request(url=url, headers=header)

#  以 utf-8 的格式打印出访问的页面

test_2 = urllib.request.urlopen(test).read().decode("utf-8")

print (test_2)

7、发送带参数的 POST 请求

import urllib.request

import urllib.parse

#  指定访问的 URL

url = "http://httpbin.org/post"

#  指定访问的 Headers

header = {

    "Host": "httpbin.org",

    "Origin": "http://httpbin.org",

    "Referer": "http://httpbin.org/",

    "User-Agent": "Mozilla/5.0 (Windows NT 99.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.83 Safari/537.36",

}

#  设置需传递的参数（使用 urlencode 将字典转换成可提交的参数，如：a=test_1&b=test_2）

data = urllib.parse.urlencode({'a':'test_1', 'b':'test_2'})

#  将序列化后的字符串转换成二进制数据（POST 请求携带的参数是二进制）

data = bytes(data, encoding='utf-8')

#  使用指定的 Headers 访问网页

test = urllib.request.Request(url=url, headers=header, data = data, method="POST")

#  指定新的 Headers（接受元组类型（会替换掉对应的项））

test.add_header("User-Agent", "Mozilla/99.0 (Windows NT 99.0; Win99; x99) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.83 Safari/537.36",

)

#  以 utf-8 的格式打印出访问的页面

test_2 = urllib.request.urlopen(test).read().decode("utf-8")

print (test_2)

8、设置全局代理

import urllib.request

#  需访问测试页面

url = "http://httpbin.org/ip"

#  设置代理 IP

ip = {"http":"127.0.0.1:8888"}

proxy_ip = urllib.request.ProxyHandler(ip)

#  使用 build_opener() 构建一个 opener 对象

opener = urllib.request.build_opener(proxy_ip)

#  设置新的 Headers

header = ('User-Agent','Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/83.0.4103.97 Safari/537.36')

opener.addheaders = [header]

urllib.request.install_opener(opener)

#  访问测试的页面

response = urllib.request.urlopen(url)

#  以 utf-8 的格式打印出访问的页面

html = response.read().decode('utf-8')

print (html)

python urllib.request的更多相关文章

第14.6节使用Python urllib.request模拟浏览器访问网页的实现代码
Python要访问一个网页并读取网页内容非常简单,在利用<第14.5节利用浏览器获取的http信息构造Python网页访问的http请求头>的方法构建了请求http报文的请求头情况下,使 ...
Python urllib Request 用法
转载自:https://blog.csdn.net/ywy0ywy/article/details/52733839 python2.7 httplib, urllib, urllib2, reque ...
第14.9节 Python中使用urllib.request+BeautifulSoup获取url访问的基本信息
利用urllib.request读取url文档的内容并使用BeautifulSoup解析后,可以通过一些基本的BeautifulSoup对象输出html文档的基本信息.以博文<第14.6节使用 ...
Python Spider - urllib.request
import urllib.request import urllib.parse import json proxy_support = urllib.request.ProxyHandler({' ...
Python 基于urllib.request封装http协议类
基于urllib.request封装http协议类 by:授客QQ:1033553122 测试环境: Python版本:Python 3.3 代码实践 #!/usr/bin/env python ...
Python 3.X 要使用urllib.request 来抓取网络资源。转
Python 3.X 要使用urllib.request 来抓取网络资源. 最简单的方式: #coding=utf-8 import urllib.request response = urllib. ...
Python做简单爬虫（urllib.request怎么抓取https以及伪装浏览器访问的方法）
一:抓取简单的页面: 用Python来做爬虫抓取网站这个功能很强大,今天试着抓取了一下百度的首页,很成功,来看一下步骤吧首先需要准备工具: 1.python:自己比较喜欢用新的东西,所以用的是Pyt ...
python之urllib.request.urlopen(url)报错urllib.error.HTTPError: HTTP Error 403: Forbidden处理及引申浏览器User Agent处理
最近在跟着院内大神学习python的过程中,发现使用urllib.request.urlopen(url)请求服务器是报错: 在园子里找原因,发现原因为: 只会收到一个单纯的对于该页面访问的请求,但是 ...
通过python的urllib.request库来爬取一只猫
我们实验的网站很简单,就是一个关于猫的图片的网站:http://placekitten.com 代码如下: import urllib.request respond = urllib.request ...

随机推荐

XCTF-WEB-高手进阶区-upload1-笔记
这道题摸索着弄出了两种解法思路大体都是跳过前端的后缀名过滤从而达到上传一句话木马的目的,之后使用菜刀&蚁剑来进行链接获取Flag <script type="text/jav ...
我搭的神经网络不work该怎么办！看看这11条新手最容易犯的错误
1. 忘了数据规范化 2. 没有检查结果 3. 忘了数据预处理 4. 忘了正则化 5. 设置了过大的批次大小 6. 使用了不适当的学习率 7. 在最后一层使用了错误的激活函数 8. 网络含有不良梯度 ...
csapp第六章笔记-存储器结构
目录随机访问存储器(Random-Access-Memory) 静态RAM 动态RAM 增强的DRAM 非易失性存储器磁盘存储磁盘构成磁盘容量磁盘操作逻辑磁盘块访问磁盘和连接I/O设备 ...
Java学习书籍与社区
编码规范:<阿里巴巴Java开发手册> 技术架构:<大型网站技术架构核心原理与案例分析>---李智慧 Spring架构与设计原理解析:<Spring技术内幕深入解析Spr ...
centos go 安装使用
#goland 确保能ping通百度[root@z my_project]# vi /etc/resolv.conf# Generated by NetworkManagersearch locald ...
Collections.synchronizedMap()与ConcurrentHashMap区别
Collections.synchronizedMap()与ConcurrentHashMap主要区别是:Collections.synchronizedMap()和Hashtable一样,实现上在调 ...
leetcode刷题记录——哈希表
1.两数之和可以先对数组进行排序,然后使用双指针方法或者二分查找方法.这样做的时间复杂度为 O(NlogN),空间复杂度为 O(1). 用 HashMap 存储数组元素和索引的映射,在访问到 num ...
Java之NIO与IO比较分析
Java NIO(New Input/Output)——新的输入/输出API包——是2002年引入到J2SE 1.4里的.Java NIO的目标是提高Java平台上的I/O密集型任务的性能. 简单描述 ...
unsigned char printf 如何输出
参考链接:https://blog.csdn.net/m0_37362454/article/details/88639668 #include <stdio.h> int main() ...
linux tmpfs及消耗内存脚本
一.tmpfs介绍 tmpfs是一种虚拟内存文件系统,正如这个定义它最大的特点就是它的存储空间在VM里面VM是由linux内核里面的vm子系统管理的东西,现在大多数操作系统都采用了虚拟内存管理机制VM ...