Python爬虫-urllib的基本用法

from urllib import response,request,parse,error

from http import  cookiejar

if __name__ == '__main__':

    #response = urllib.request.urlopen("http://www.baidu.com")

    #print(response.read().decode("utf-8"))

    #以post形式发送，没有data就是get形式

    #请求头

    #data = bytes(urllib.parse.urlencode({"word":"hello"}),encoding="utf-8")

    #response = urllib.request.urlopen("http://httpbin.org/post",data=data)

    #print(response.read())

    #时间限制

    #response = urllib.request.urlopen("http://www.baidu.com",timeout=0.01)

    #print(response.read().decode("utf-8"))

    #响应处理

    #response = urllib.request.urlopen("http://www.python.org")

    #print(type(response))

    #状态码

    #print(response.status)

    #相应头

    #print(response.getheaders())

    #print(response.getheader("Server"))

    #复杂请求 request

    #request = urllib.request.Request("http://python.org")

    #response = urllib.request.urlopen(request)

    #print(response.read().decode("utf-8"))

    #请求头

    # add_header也可以

    """

    url = "http://httpbin.org/post"

    headers = {

        "User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64)",

        "Host":"httpbin.org"

    }

    dict = {

        "name":"Germey"

    }

    data = bytes(parse.urlencode(dict),encoding="utf8")

    req = request.Request(url,data,headers,method="POST")

    response = request.urlopen(req);

    print(response.read())

    """

    #代理

    """

    proxy_header = request.ProxyHandler({

        #代理IP

    })

    opener = request.build_opener(proxy_header)

    response = opener.open("http://httpbin.org/get")

    #cookies(维持登录状态)

    cookie = cookiejar.CookieJar()

    handler = request.HTTPCookieProcessor(cookie)

    opener = request.build_opener(handler)

    response = opener.open("http://www.baidu.com")

    """

    #保存cookies

    #MozillaCookieJar,LWPCookieJar

    #捕捉异常 基本上HTTPError或者URLError

    """

    try:

        response = request.urlopen("http://amojury.github.io")

    except error.URLError as e:

        print(e.reason)

    """

    #URL解析相关 urlparse urlunparse(反解析) urlencode(字典转请求参数）

    #result = parse.urlparse("https://www.baidu.com/s?ie=utf-8&f=3&rsv_bp=0&rsv_idx=1&tn=baidu&wd=python%20%E6%89%B9%E9%87%8F%E6%B3%A8%E9%87%8A&rsv_pq=f9b1a8b300011700&rsv_t=1252nVpaBhdm%2FEdlsdrPgUxIHLfk4QNB443eSTUKoRcHFx9G09YZi9N9Dvo&rqlang=cn&rsv_enter=1&rsv_sug3=9&rsv_sug1=8&rsv_sug7=101&rsv_sug2=1&prefixsug=python%2520%25E6%2589%25B9%25E9%2587%258F&rsp=0&inputT=10498&rsv_sug4=14994")

    #print(result)

Python爬虫-urllib的基本用法的更多相关文章

Python爬虫Urllib库的高级用法
Python爬虫Urllib库的高级用法设置Headers 有些网站不会同意程序直接用上面的方式进行访问,如果识别有问题,那么站点根本不会响应,所以为了完全模拟浏览器的工作,我们需要设置一些Head ...
python爬虫---selenium库的用法
python爬虫---selenium库的用法 selenium是一个自动化测试工具,支持Firefox,Chrome等众多浏览器在爬虫中的应用主要是用来解决JS渲染的问题. 1.使用前需要安装这个 ...
Python爬虫Urllib库的基本使用
Python爬虫Urllib库的基本使用深入理解urllib.urllib2及requests 请访问: http://www.mamicode.com/info-detail-1224080.h ...
python爬虫 urllib模块url编码处理
案例:爬取使用搜狗根据指定词条搜索到的页面数据(例如爬取词条为‘周杰伦'的页面数据) import urllib.request # 1.指定url url = 'https://www.sogou. ...
python 爬虫 urllib模块目录
python 爬虫 urllib模块介绍 python 爬虫 urllib模块 url编码处理 python 爬虫 urllib模块反爬虫机制UA python 爬虫 urllib模块发起post ...
python爬虫---urllib库的基本用法
urllib是python自带的请求库,各种功能相比较之下也是比较完备的,urllib库包含了一下四个模块: urllib.request 请求模块 urllib.error 异常处理模块 u ...
python爬虫 - Urllib库及cookie的使用
http://blog.csdn.net/pipisorry/article/details/47905781 lz提示一点,python3中urllib包括了py2中的urllib+urllib2. ...
Python爬虫之BeautifulSoup的用法
之前看静觅博客,关于BeautifulSoup的用法不太熟练,所以趁机在网上搜索相关的视频,其中一个讲的还是挺清楚的:python爬虫小白入门之BeautifulSoup库,有空做了一下笔记: 一.爬 ...
Python爬虫urllib模块
Python爬虫练习(urllib模块) 关注公众号"轻松学编程"了解更多. 1.获取百度首页数据流程:a.设置请求地址 b.设置请求时间 c.获取响应(对响应进行解码) ''' ...

随机推荐

Linux遇到的两个问题
编译C++的和编译C语言的命令不同. 编译C++,应当先安装g++. 然后可以用#g++ filename.cpp -o filename 进行编译编译C语言是用#gcc filename.c -o ...
在xadmin中自定义内容的变量及优化汇总
在网上找了很多有关xadmin的内容,发现都不太全 ,找到一篇总结不错的 http://www.lybbn.cn/data/bbsdatas.php?lybbs=62 1.list_display 指 ...
tap事件的原理详解
点击事件延迟问题所在: 在移动端中,由于两次触摸是放大操作,,所以当你点击一次的时候,浏览器会等待300ms,看用户是否会进行第二次点击,如果没有的话,才会执行点击事件为什么要解决: 随着h5游戏, ...
阿里云ECS/Ubuntu下***浅析
公司项目中需要WebRTC作为即时通讯部分的核心技术,这部分的开发由我负责.实际上手前需要访问谷歌进行源码的下载以及编译,在这里记录下我各种折腾服务器***过程. 目前手上有两台阿里云ESC: 华南节 ...
数学：Nim游戏和SG函数
有若干堆石子,两人轮流从中取石子,取走最后一个石子的人为胜利者以下的性质是显然的 .无法移动的状态是必败态 .可以移动到必败态的局面一定是非必败态 .在必败态做所有操作的结果都是非必败态在普通Ni ...
(function($){})(jQuery)---Javascript的神级特性:闭包
function($){}实际上是匿名函数这就定义了一个匿名函数,参数为arg function(arg){ //code } 而调用函数时,是在函数后面写上括号和实参的,由于操作符的优先级,函数 ...
朋友封装的一个ASP.NET上传文件的方法
朋友做了asp.net开发多年,做了这个,自我感觉封装得还不错!!! 代码如下: #region 上传文件的方法 /// <summary> /// 上传文件方法 /// </sum ...
【leetcode 简单】第五十一题有效电话号码
给定一个包含电话号码列表(一行一个电话号码)的文本文件 file.txt,写一个 bash 脚本输出所有有效的电话号码. 你可以假设一个有效的电话号码必须满足以下两种格式: (xxx) xxx-xxx ...
实现字符串检索strstr函数、字符串长度strlen函数、字符串拷贝strcpy函数
#include <stdio.h> #include <stdlib.h> #include <string.h> /* _Check_return_ _Ret_ ...
antdVG6随记
g6是一个很棒的可视化工具目前支持开发者搭建属于自己的图,图分析.图应用.图编辑器图编辑器可以支持多种图例的创建 G6 是一个简单.易用.完备的图可视化引擎,它在高定制能力的基础上,提供了一系列设 ...

Python爬虫-urllib的基本用法

Python爬虫-urllib的基本用法的更多相关文章

随机推荐

热门专题