python爬虫爬取get请求的页面数据代码样例

废话不多说，上代码

#!/usr/bin/env python

# -*- coding:utf-8 -*-

# 导包

import urllib.request

import urllib.parse

# 如下两行代码表示忽略https证书，如果请求不是https则该两行代码可不用。

import ssl

ssl._create_default_https_context = ssl._create_unverified_context

if __name__ == "__main__":

    """指定爬取的网页URL"""

    url = 'https://www.baidu.com'

    """通过urlopen函数向指定url发起请求，返回响应对象"""

    response = urllib.request.urlopen(url)

    """通过调用相应对象中的read函数，反馈响应回客户端的数据值（爬到的数据）"""

    data = response.read()  # 获取响应中的数据值（字节类型）

    # data = response.geturl() # 获取请求的url

    # data = response.getcode() # 获取响应状态码

    # data = response.headers() # 获取响应头信息

    # data = str(data, encoding="utf-8")  # 方法一、使用str()函数将bytes类型转换为str类型

    # data = bytes.decode(data)  # 方法二、使用bytes.decode()函数将bytes类型转换为str类型

    data = response.read().decode()  # 方法三、decode()将响应中字节（byte）类型的数据值转成字符串类型

    with open('./baidu.html', 'w') as e:  #使用IO操作将data表示的数据值以'w'权限的方式写入到baidu.html文件中

        e.write(data)

    print('写入文件完毕')

"""

1、爬取网络上某张图片数据，且存储到本地

if __name__ == '__main__':

    url = 'http://image.baidu.com/search/detail?ct=503316480&z=0&ipn=d&word=%E5%9B%BE%E7%89%87&step_word=&hs=0&pn=5&spn=0&di=103290&pi=0&rn=1&tn=baiduimagedetail&is=0%2C0&istype=0&ie=utf-8&oe=utf-8&in=&cl=2&lm=-1&st=undefined&cs=3139953554%2C3011511497&os=282365737%2C413977936&simid=0%2C0&adpicid=0&lpn=0&ln=737&fr=&fmq=1564044690482_R&fm=&ic=undefined&s=undefined&hd=undefined&latest=undefined&copyright=undefined&se=&sme=&tab=0&width=undefined&height=undefined&face=undefined&ist=&jit=&cg=&bdtype=0&oriquery=&objurl=http%3A%2F%2Fpic30.nipic.com%2F20130619%2F9885883_210838271000_2.jpg&fromurl=ippr_z2C%24qAzdH3FAzdH3Fooo_z%26e3Bgtrtv_z%26e3Bv54AzdH3Ffi5oAzdH3F8AzdH3F9aAzdH3Fbdl0c0lhu9kvac8k_z%26e3Bip4s&gsm=0&rpstart=0&rpnum=0&islist=&querylist=&force=undefined'

    response = urllib.request.urlopen(url)

    data = response.read()  # 因为爬取的是图片数据值(二进制数据)，则无需使用decode进行类型转换。

    with open('./bird.jpg', 'wb') as e:  # 视频、图片等流式数据（二进制数据）使用'wb'进行写入

        e.write(data)

    print('写入完毕')

2、爬取使用百度根据指定词条搜索到的页面数据（例如爬取词条为‘蔡徐坤’的页面数据）

url的特性：url必须为ASCII编码的数据值。所以我们在爬虫代码中编写url时，如果url中存在非ASCII编码的数据值，则必须对其进行ASCII编码后，该url方可被使用

if __name__ == "__main__":

    #原始url中存在非ASCII编码的值，则该url无法被使用。

    #url = 'http://www.baidu.com/s?wd=蔡徐坤'

    #处理url中存在的非ASCII数据值

    url = 'http://www.baidu.com/s?'

    #将带有非ASCII的数据封装到字典中，url中非ASCII的数据往往都是'?'后面键值形式的请求参数

    param = {

        'wd':'蔡徐坤'

    }

    #使用parse子模块中的urlencode函数将封装好的字典中存在的非ASCII的数值进行ASCII编码

    param = urllib.parse.urlencode(param)

    #将编码后的数据和url进行整合拼接成一个完整可用的url

    url = url + param

    #伪装UA

    #将浏览器的UA数据获取，封装到一个字典中。该UA值可以通过抓包工具或者浏览器自带的开发者工具中获取某请求，从中获取UA的值

    headers={

        'User-Agent' : 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3440.106 Safari/537.36'

    }

    #自定义一个请求对象

    #参数：url为请求的url，headers为UA的值，data为post请求的请求参数（后续介绍）

    request = urllib.request.Request(url=url,headers=headers)

    #发送我们自定义的请求（该请求的UA已经进行了伪装）

    response = urllib.request.urlopen(request)

    data = response.read()

    with open('./蔡徐坤.html','wb') as e:

        e.write(data)

    print('写入文件完毕')

"""

python爬虫爬取get请求的页面数据代码样例的更多相关文章

02. 爬取get请求的页面数据
目录 02. 爬取get请求的页面数据一.urllib库二.由易到难的爬虫程序: 02. 爬取get请求的页面数据一.urllib库 urllib是Python自带的一个用于爬虫的库,其主要作用 ...
爬虫（二）Python网络爬虫相关基础概念、爬取get请求的页面数据
什么是爬虫爬虫就是通过编写程序模拟浏览器上网,然后让其去互联网上抓取数据的过程. 哪些语言可以实现爬虫 1.php:可以实现爬虫.php被号称是全世界最优美的语言(当然是其自己号称的,就是王婆 ...
Python网络爬虫第三弹《爬取get请求的页面数据》
一.urllib库 urllib是Python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在Python3中的为urllib.request和urllib. ...
Python爬虫《爬取get请求的页面数据》
一.urllib库 urllib是Python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在Python3中的为urllib.request和urllib. ...
python网络爬虫第三弹(<爬取get请求的页面数据>)
一.urllib库 urllib是python自带的一个用于爬虫的库,其主要作用就是通过代码模拟浏览器发送请求,其常被用到的子模块在 python3中的为urllib.request 和 urllib ...
python网络爬虫《爬取get请求的页面数据》
一.urllib库 urllib是python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在python3中的为urllib.request和urllib. ...
Python爬虫爬取异步加载的数据
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理.作者:努力努力再努力爬取qq音乐歌手数据接口数据 https://y.qq ...
用Python爬虫爬取广州大学教务系统的成绩（内网访问）
用Python爬虫爬取广州大学教务系统的成绩(内网访问) 在进行爬取前,首先要了解: 1.什么是CSS选择器? 每一条css样式定义由两部分组成,形式如下: [code] 选择器{样式} [/code ...
使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...

随机推荐

Docker 安装 MySQL 并实现远程连接
获取 MySQL 镜像 docker pull mysql:5.6 查看镜像列表 docker images 启动 MySQL 镜像 docker run -itd -P mysql:5.6 bash ...
Xcode UI界面调试神器-injectionIII
App Store搜索injectionIII下载即可,免费的哟. 打开injectionIII,运行即可. - (BOOL)application:(UIApplication *)applicat ...
js set集合转数组 Array.from的使用方法
1.set集合转化Array数组注意:这个可以使用过滤数组中的重复的元素你可以先把数组转化为set集合然后在把这个集合通过Array.from这个方法把集合在转化为数组 var set = n ...
golang 基于channel封装资源池（可用于封装redis、mq连接池）
package pool import ( "errors" "io" "sync" "time" ) var ( Er ...
使用 pthread_cancel 引入的死锁问题
先来说一下 pthread_cancel 基本概念. pthread_cancel 调用并不是强制终止线程,它只提出请求.线程如何处理 cancel 信号则由目标线程自己决定,可以是忽略.可以是立即终 ...
springboot统一返回json数据格式并配置系统异常拦截
本文链接:https://blog.csdn.net/syystx/article/details/82870217通常进行前后端分离开发时我们需要定义统一的json数据交互格式并对系统未处理异常进行 ...
docker+k8s基础篇一
Docker+K8s基础篇(一) docker的介绍 A:为什么是docker B:k8s介绍 docker的使用 A:docker的安装 B:docker的常用命令 C:docker容器的启动和操作 ...
【转帖】MIPS构架之：我和龙芯有个约会
MIPS构架之:我和龙芯有个约会 https://www.eefocus.com/mcu-dsp/364490 <处理器史话>之十二 2016-06-24 12:21 作者:付丽华预计 1 ...
《Docker Deep Dive》Note - 纵观 Docker
<Docker Deep Dive>Note 由于GFW的隔离,国内拉取镜像会报TLS handshake timeout的错误:需要配置 registry-mirrors 为国内源解决这 ...
Android--创建快捷方式
需要权限: <uses-permission android:name="com.android.launcher.permission.READ_SETTINGS" /&g ...

python爬虫爬取get请求的页面数据代码样例

python爬虫爬取get请求的页面数据代码样例的更多相关文章

随机推荐

热门专题