Python3爬虫（一）HTTP相关基础

Infi-chu:

http://www.cnblogs.com/Infi-chu/

一、URI、URL、URN、HTTP

URI：统一资源标志符

URL：是URI的一个子集

URN：是URI的另一个子集，统一资源名称

HTTP协议：
　　超文本传输协议，是一个基于“请求与响应”模式的、无状态的引用层协议。
　　HTTP协议采用URL作为定位网络资源的标识。
　　URL格式 http://host[:port][path]

二、请求

1.请求方法

2.请求的网址

3.请求头

4.请求体

三、响应：

1.响应状态码

2.响应头

3.响应体

四、GET和POST的区别：

1.GET相对于POST较不安全，GET将参数包含在URL里面，POST是通过表单形式传输的，包含在请求体中。

2.GET最多提交的数据大小为1024字节，POST没有限制

3.GET效率较高与POST

五、DOM

1.含义：文档对象模型，定义了访问HTML和XML文档标准

2.DOM：

　　1.核心DOM：针对任何结构化文档的标准模型

　　2.XML DOM：针对XML文档的标准模型

　　3.HTML DOM：针对HTML文档的标准模型

　　　　a.整个文档是一个文档节点

　　　　b.每个HTML元素是元素节点

　　　　c.HTML元素内的文本是文本节点

　　　　d.每个HTML属性是属性节点

　　　　e.注释是注释节点

【注】

节点树中的节点，批次拥有层级关系，常用的有父节点（parent）、子节点（child）、兄弟节点（sibling）

六、爬虫爬取的步骤：

1.获取网页

2.提取信息

3.保存数据

4.自动化爬取程序

七、代理的作用：

1.突破自身IP访问限制，访问一些平时不能访问的站点

2.访问一些单位或团体的内部资源

3.提高访问速度

4.隐藏真实IP

八、代理的分类

1.根据协议分类：

　　协议　　一般开放端口

　　FTP　　21、2121

　　HTTP 80、8080、3128

　　SSL/TLS 443

　　RTSP　 554

　　Telnet　 23

　　POP3/SMTP　　110/25

　　SOCKS　　1080

2.根据匿名程度分类：

　　a.高度匿名代理

　　b.普通匿名代理

　　c.透明代理

　　d.间谍代理

Python3爬虫（一）HTTP相关基础的更多相关文章

Python 爬虫六性能相关
前面已经讲过了爬虫的两大基础模块: requests模块:用来伪造请求爬取数据 bs4模块:用来整理,提取数据当我们真正的开始有需求的时候通常都是批量爬取url这样的.那如何批量爬取呢? 按照正常的 ...
Python3 爬虫之 Scrapy 核心功能实现（二）
博客地址:http://www.moonxy.com 基于 Python 3.6.2 的 Scrapy 爬虫框架使用,Scrapy 的搭建过程请参照本人的另一篇博客:Python3 爬虫之 Scrap ...
Python3爬虫系列：理论+实验+爬取妹子图实战
Github: https://github.com/wangy8961/python3-concurrency-pics-02 ,欢迎star 爬虫系列: (1) 理论 Python3爬虫系列01 ...
python3爬虫系列19之反爬随机 User-Agent 和 ip代理池的使用
站长资讯平台:python3爬虫系列19之随机User-Agent 和ip代理池的使用我们前面几篇讲了爬虫增速多进程,进程池的用法之类的,爬虫速度加快呢,也会带来一些坏事. 1. 前言比如随着我们爬虫 ...
小白学 Python 爬虫（35）：爬虫框架 Scrapy 入门基础（三） Selector 选择器
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
小白学 Python 爬虫（38）：爬虫框架 Scrapy 入门基础（六） Item Pipeline
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
小白学 Python 爬虫（40）：爬虫框架 Scrapy 入门基础（七）对接 Selenium 实战
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
小白学 Python 爬虫（41）：爬虫框架 Scrapy 入门基础（八）对接 Splash 实战
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇小白学 Python 爬虫(2):前置准备(一)基本类库的安装小白学 Python 爬虫(3):前置准备(二)Li ...
Python3爬虫：（一）爬取拉勾网公司列表
人生苦短,我用Python 爬取原因:了解一下Python工程师在北上广等大中城市的薪资水平与入职前要求. Python3基础知识 requests,pyquery,openpyxl库的使用爬取前的 ...
Python爬虫入门有哪些基础知识点
1.什么是爬虫爬虫,即网络爬虫,大家可以理解为在网络上爬行的一直蜘蛛,互联网就比作一张大网,而爬虫便是在这张网上爬来爬去的蜘蛛咯,如果它遇到资源,那么它就会抓取下来.想抓取什么?这个由你来控制它咯. ...

随机推荐

一键生成http服务器
如果你想用最简单的方法在内网共享目录,可以考虑为要共享的目录生成一个http服务器,这样就可以在内网任一台设备打开浏览器就可以浏览了.简单举几个例,有了这个http服务器就可以: 在手机浏览器里观看电 ...
诊断GRID无法启动问题
诊断 Grid Infrastructure 启动问题 (文档 ID 1623340.1)
OC extern和变量
注意: extern只能用来声明全部变量,不能拿来定义变量 #include <stdio.h> // 第一种做法是将a定义在main函数的前面 // int a; // 完整地声明全部变 ...
C语言变量类型
// a是一个全局变量,静态变量 int a; void test() { // b是一个局部变量,自动变量 ; b++; // c是一个局部变量,静态变量 ; c++; printf("b ...
jquery.dataTables列中内容居中问题?求解？
.table > tbody > tr > td { vertical-align: middle; }
Android（java）学习笔记2：继承Thread类创建线程类
1. 继承Thread类创建线程类: package cn.itcast_02; /* * 该类要重写run()方法,为什么呢? * 不是类中的所有代码都需要被线程执行的. * 而这个时候,为了区分 ...
【[CTSC2018]混合果汁】
题目 \(CTSC\)也有这么水的题啊首先看到美味值来自于最小的美味值,我们就可以先考虑把所有的果汁按照美味值排序接下来可以考虑二分,二分出一个\(mid\)我们只使用美味值大于等于\(mid\) ...
【转】android Looper 理解
在主线程中运行的部分,都可以直接使用Handler,因为在主线程启动的过程中(ActivityThread的main函数里)会调用Looper.prepareMainLooper(),Looper类中 ...
2018中国大学生程序设计竞赛 - 网络选拔赛 1001 - Buy and Resell 【优先队列维护最小堆+贪心】
题目传送门:http://acm.hdu.edu.cn/showproblem.php?pid=6438 Buy and Resell Time Limit: 2000/1000 MS (Java/O ...
使用canvas上传图片+上传进度
实现效果: 速度过快,调式浏览器方式:F12 后台java代码 public String imageshangchuan(@RequestPart("xxx") Multipar ...

Python3爬虫（一）HTTP相关基础

Python3爬虫（一）HTTP相关基础的更多相关文章

随机推荐

热门专题