requests应用

　　　　　　一、简介

什么是requests模块:

requests模块是python中原生的基于网络请求的模块，其主要作用是用来模拟浏览器发起请求。功能强大，用法简洁高效。在爬虫领域中占据着半壁江山的地位。

为什么要使用requests模块

因为在使用urllib模块的时候，会有诸多不便之处，总结如下：
- 手动处理url编码
- 手动处理post请求参数
- 处理cookie和代理操作繁琐
- ......
使用requests模块：
- 自动处理url编码
- 自动处理post请求参数
- 简化cookie和代理操作
- ......

　　　　　　二、使用

安装：

pip install requests

requests模块的使用流程

- 指定url
- 发起请求
- 获得响应数据
- 持久化存储

　　　　　　　　　　　　案例：

　　　　　　　　1、爬取搜狗搜索后的响应页面

import requests

url = 'https://www.sogou.com/web'

# 处理参数

wd = input("enter a word: ")

param = {

    'query':wd

}

# UA伪装

# User-Agent 请求头信息。请求载体的身份标识

headers = {

    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.12 Safari/537.36'

}

# 发起请求

response = requests.get(url,params=param,headers=headers)

# 获取响应数据

page_text = response.content

# 持久化存储

fileName = wd + ".html"

with open(fileName, 'wb') as f:

    f.write(page_text) 

print(f"{wd}下载成功")

　　在爬取并存储图片时urllib模块比较方便

# 使用urllib模块爬取图片

from urllib import request

url = "https://gss2.bdstatic.com/9fo3dSag_xI4khGkpoWK1HF6hhy/baike/w%3D268%3Bg%3D0/sign=081aba3563224f4a5799741531ccf76f/c83d70cf3bc79f3d423d2823b4a1cd11738b29c1.jpg"

request.urlretrieve(url=url, filename='ycy.jpg')

2、用requests模块发起post请求获取百度翻译后的结果

import requests

headers = {

    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.12 Safari/537.36'

}

url = 'https://fanyi.baidu.com/sug'  # ajax请求

wd = input("enter a english word: ")

# 参数的处理

data = {

    "kw": wd

}

# 发送post请求

response = requests.post(url=url,data=data,headers=headers)

# 如果确定返回的是json格式的数据，就可以直接.json拿到json对象

json_data = response.json()

print(json_data)

print(type(response.text))

3、肯德基门店查询

import requests

headers = {

    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.12 Safari/537.36'

}

url = "http://www.kfc.com.cn/kfccda/ashx/GetStoreList.ashx?op=keyword"

wd = input('请输入查询地点：')

data = {

    'cname': '',

    'pid': '',

    'keyword': wd,

    'pageIndex': '1',

    'pageSize': '100',

}

json_data = requests.post(url=url, data=data, headers=headers).json()

print(json_data)

4、爬取化妆品生产许可信息管理系统服务平台http://125.35.6.84:81/xk/，每个公司详情页的数据。

需求分析：指定页面的公司，该公司的详情页数据

# 域名：http://125.35.6.84:81/xk/

import requests

headers = {

    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.12 Safari/537.36'

}

# 首页url

url = 'http://125.35.6.84:81/xk/itownet/portalAction.do?method=getXkzsList'

id_list = []

start_page= int(input('起始页：'))

end_page= int(input('结束页：'))

for i in range(start_page,end_page+1):

    data = {

        'on': 'true',

        'page': str(i),

        'pageSize': '15',

        'productName':'' ,

        'conditionType': '1',

        'applyname': '',

        'applysn': '',

    }

    json_data = requests.post(url=url,data=data,headers=headers).json()

    # print(json_data)

    for item in json_data['list']:

        id_list.append(item["ID"])

# 详情页url

url2 = 'http://125.35.6.84:81/xk/itownet/portalAction.do?method=getXkzsById'

for id_item in id_list:

    data_id = {

        'id': id_item

    }

    json_data2 = requests.post(url=url2,data=data_id,headers=headers).json()

    print(json_data2)

requests应用的更多相关文章

requests的content与text导致lxml的解析问题
title: requests的content与text导致lxml的解析问题 date: 2015-04-29 22:49:31 categories: 经验 tags: [Python,lxml, ...
requests源码阅读学习笔记
0:此文并不想拆requests的功能,目的仅仅只是让自己以后写的代码更pythonic.可能会涉及到一部分requests的功能模块,但全看心情. 1.另一种类的初始化方式 class Reques ...
Python爬虫小白入门（二）requests库
一.前言为什么要先说Requests库呢,因为这是个功能很强大的网络请求库,可以实现跟浏览器一样发送各种HTTP请求来获取网站的数据.网络上的模块.库.包指的都是同一种东西,所以后文中可能会在不同地 ...
使用beautifulsoup与requests爬取数据
1.安装需要的库 bs4 beautifulSoup requests lxml如果使用mongodb存取数据,安装一下pymongo插件 2.常见问题 1> lxml安装问题如果遇到lxm ...
python爬虫学习(6) —— 神器 Requests
Requests 是使用 Apache2 Licensed 许可证的 HTTP 库.用 Python 编写,真正的为人类着想. Python 标准库中的 urllib2 模块提供了你所需要的大多数 H ...
ImportError: No module named 'requests'
补充说明: 当前环境是在windows环境下 python版本是:python 3.4. 刚开始学习python,一边看书一边论坛里阅读感兴趣的代码, http://www.oschina.net/c ...
Python-第三方库requests详解
Requests 是用Python语言编写,基于 urllib,采用 Apache2 Licensed 开源协议的 HTTP 库.它比 urllib 更加方便,可以节约我们大量的工作,完全满足 HTT ...
Requests 乱码
当使用Requests请求网页时,出现下面图片中的一些乱码,我就一脸蒙逼. 程序是这样的. def getLinks(articleUrl): headers = { "Uset-Agent ...
爬虫requests模块 2
会话对象¶ 会话对象让你能够跨请求保持某些参数.它也会在同一个 Session 实例发出的所有请求之间保持 cookie, 期间使用 urllib3 的 connection pooling 功能.所 ...
爬虫requests模块 1
让我们从一些简单的示例开始吧. 发送请求¶ 使用 Requests 发送网络请求非常简单. 一开始要导入 Requests 模块: >>> import requests 然后,尝试 ...

随机推荐

2.Yum仓库优化
1.[初始yum源备份]-[yum更换为国内源]-[添加epel扩展源] #!/bin/bash mkdir /etc/yum.repos.d/backup/ mv /etc/yum.repos.d/ ...
maven pom.xml 项目报错
Failed to read artifact descriptor for org.springframework.boot:spring-boot-starter-web:jar:2.1.0.RE ...
在阿里云Ubuntu 14.04 Linux服务器上安装docker
参考 How To Install and Use Docker: Getting Started 这篇最靠谱的文档在阿里云 Ubuntu 14.04 服务器上成功安装 docker . ---- ...
NodeJs学习相关网址
node官方中文 https://nodejs.org/zh-cn/ Node.js 中文网 https://nodejs.org/zh-cn/ Node.js 教程 | 菜鸟教程 http: ...
Windbg断点调试
[文章主题] Windbg是Windows驱动调试的重要软件,也是必须学习的软件,前面的博客介绍了一些双机调试的环境配置,只要按照我所说的步骤一步步下来就可以完成环境搭建. 本文主要介绍如何调试sys ...
mysql 查看字段是否添加了索引
show index from 数据库名.表名: 如果是在Navicat这些客户端可以不用写数据库名.
uvm_pre_do
https://blog.csdn.net/tingtang13/article/details/46535649 1.uvm_do 封装了一系列接口,封装越多,灵活性越差.所以增加了三个接口:pre ...
Mark，20180127，技术博客之路开启！
不怎么会说话,自己本身少说话的撸码loner,少说多做.毕业从事手游一年多,之前主要从事Cocos2dx,刚转投Unity不到一个月,后面主要总结下自己在这两方面开发过程中的一些历程,希望自己能有所积 ...
Linux基础知识回顾及BASH学习
2019-2020-030189224 <网络攻防技术与实践>第一周学习总结 Linux基础知识错题回顾 1.Linux中使用(B)命令新建空白文件. A .mkdir B .touch ...
AltiumDesigner PCB中栅格与格点的切换
PCB中通过快捷键Ctrl+G,进入设置界面. 在弹出的对话框中,在Display,Coarse选择Lines为栅格,Dots为格点,Do Not Draw为无任何显示.

requests应用

一、简介

二、使用

案例：

1、爬取搜狗搜索后的响应页面

2、用requests模块发起post请求获取百度翻译后的结果

3、肯德基门店查询

4、爬取化妆品生产许可信息管理系统服务平台http://125.35.6.84:81/xk/，每个公司详情页的数据。

requests应用的更多相关文章

随机推荐

热门专题

　　　　　　一、简介

　　　　　　二、使用

　　　　　　　　　　　　案例：

　　　　　　　　1、爬取搜狗搜索后的响应页面