Python-网站页面代码获取

Python3.6

库：urllib3, bs4

主程序是抓取亚马逊图书销售排名数据，但是亚马逊应该是加了反爬虫，拒绝疑似机器人的请求，这部分暂时以百度代替。

其实简单的页面抓取，常用的urllib.request就能实现，但是urllib3功能更多，应用前景更广，需要学习。

首先导入模块：

import urllib3, bs4

定义要访问的页面：

urltest = 'https://www.baidu.com'

定义函数，这里对比两种解码方法：

def httpget():

    http = urllib3.PoolManager()   #首先产生一个PoolManager实例

    urllib3.disable_warnings()     #忽略https的无效证书警报

    page = http.request('GET','%s'%urltest)   #发起GET请求

    print(page.status)        #服务器返回的代码

    print(page.data)          #服务器返回的数据，返回的是xml字符串

    print(page.data.decode())  #利用默认'utf-8'编码格式去解码

    res = bs4.BeautifulSoup(page.data,'lxml')  #利用lxml模块解码

    print(res)

    return None

执行函数httpget()输出结果：

200

b'<!DOCTYPE html><!--STATUS OK--><body link="#0000cc"><div ...（#省略）

<!DOCTYPE html><!--STATUS OK-->

<html>

<head>

    <meta http-equiv="content-type" content="text/html;charset=utf-8">

    <meta http-equiv="X-UA-Compatible" content="IE=Edge">

    <link rel="dns-prefetch" href="//s1.bdstatic.com"/>

    <link rel="dns-prefetch" href="//t1.baidu.com"/>

    <link rel="dns-prefetch" href="//t2.baidu.com"/>

    <link rel="dns-prefetch" href="//t3.baidu.com"/>

    <link rel="dns-prefetch" href="//t10.baidu.com"/>

    <link rel="dns-prefetch" href="//t11.baidu.com"/>

    <link rel="dns-prefetch" href="//t12.baidu.com"/>

    <link rel="dns-prefetch" href="//b1.bdstatic.com"/>

    <title>百度一下，你就知道</title>

　　...（#省略）
　　...（#省略）

</body></html>

<!DOCTYPE html>

<!--STATUS OK--><html>

<head>

<meta content="text/html;charset=utf-8" http-equiv="content-type"/>

<meta content="IE=Edge" http-equiv="X-UA-Compatible"/>

<link href="//s1.bdstatic.com" rel="dns-prefetch"/>

<link href="//t1.baidu.com" rel="dns-prefetch"/>

<link href="//t2.baidu.com" rel="dns-prefetch"/>

<link href="//t3.baidu.com" rel="dns-prefetch"/>

<link href="//t10.baidu.com" rel="dns-prefetch"/>

<link href="//t11.baidu.com" rel="dns-prefetch"/>

<link href="//t12.baidu.com" rel="dns-prefetch"/>

<link href="//b1.bdstatic.com" rel="dns-prefetch"/>

<title>百度一下，你就知道</title>

...（#省略）
...（#省略）

</body></html>

Process finished with exit code 0

在这里两种解码方式都没出错，但是如果换成比较复杂的页面，普通的decode()方式就容易报错。

比如京东这个页面：

url = 'https://item.jd.com/6072622.html'

将urltest替换成url之后执行代码，执行结果如下：

UnicodeDecodeError: 'utf-8' codec can't decode byte 0xa1 in position 146: invalid start byte

Python-网站页面代码获取的更多相关文章

使用Python开发轻量级的Web框架以及基于WSGI的服务器来实现一个网站页面
说明:该篇博客是博主一字一码编写的,实属不易,请尊重原创,谢谢大家! 目录一丶项目说明二丶数据准备三丶使用网络TCP开发一个基于WSGI协议的Web服务器四丶使用python3开发一个轻量级的 ...
Python：如何用一行代码获取上个月是几月
现在转一篇志军100发于公众号 Python之禅的文章: Python:如何用一行代码获取上个月是几月抱歉我用了个有点标题党的标题,因为担心你错过了本文,但内容绝对干货,本文介绍的关于Python时 ...
通过浏览器F12开发工具快速获取别的网站前端代码的方法
通过浏览器F12开发工具快速获取别的网站前端代码的方法说明:直接另存为网页是比较老的做法,会有很多没用的东西下载下来.通过F12开发工具,sources获取到的是比较好的,有目录结构的源文件.
测试网站页面网速的一个简单Python脚本
无聊之余,下面分享一个Python小脚本:测试网站页面访问速度 [root@huanqiu ~]# vim pywww.py #!/usr/bin/python # coding: UTF-8 imp ...
测试网站页面网速的Python脚本
一.测试网站页面网速脚本 [root@salt ~]# cat check_url.py #!/usr/bin/python # coding: UTF-8 import StringIO,pycur ...
在某网站的登录页面登录时如果选择“记住用户名”,登录成功后会跳转到一个中间层（页面代码将登录的用户名和密码存在cookie）,中间页面中存在一个超链接，单击超链接可以链接到第三个页面查看信息。若选择“
Response实现登录并记录用户名和密码信息在某网站的登录页面登录时如果选择"记住用户名",登录成功后会跳转到一个中间层(页面代码将登录的用户名和密码存在cookie),中间页 ...
使用python登录CNZZ访问量统计网站，然后获取相应的数据
思路: 第一步:使用pypeteer.launcher打开浏览器, 第二步:向CNZZ的登录(通过使用iframe嵌入的阿里巴巴单点登录页面),向iframe页面中自动输入用户名和密码,然后点击登录按 ...
[JS,NodeJs]个人网站效果代码集合
上次发的个人网站效果代码集合: 代码集合: 1.彩色文字墙[鼠标涟漪痕迹] 2.彩色旋转圆环 [模仿http://www.moma.org/interactives/exhibitions/2012/ ...
python 常忘代码查询和autohotkey补括号脚本和一些笔记和面试常见问题
笔试一些注意点: --,23点43 今天做的京东笔试题目: 编程题目一定要先写变量取None的情况.今天就是因为没有写这个边界条件所以程序一直不对.以后要注意!!!!!!!!!!!!!!!!!!!!! ...

随机推荐

高性能C++网络库libtnet实现：http
HTTP libtnet提供了简单的http支持,使用也很简单. 一个简单的http server: void onHandler(const HttpConnectionPtr_t& con ...
memcached /usr/local/memcached/bin/memcached: error while loading shared libraries: libevent-2.0.so.5: cannot open shared object file: No such file or directory
启动memcached的时候发现找不到libevent的库,这是memcache的默认查找路径不包含libevent的安装路径,所以要告诉memcached去哪里查找libevent. 操作命令如下: ...
通过服务修改widgetUI
public static void updateAppWidget(Context context, String displayMsg) { AppWidgetManager appWidgetM ...
boost::this_thread::sleep_for()死锁
boost::this_thread::sleep_for()会死锁 (金庆的专栏) 发现睡眠1ms很容易死锁.boost::this_thread::sleep_for(boost::chrono: ...
PS 滤镜算法原理——碎片效果
%%% Fragment %%% 对原图做四个方向的平移,然后对平移的结果取平均 %%% 碎片效果 clc; clear all; Image=imread('4.jpg'); Image=doubl ...
PS 图像调整算法— —渐变映射
这个调整简单来说就是先建立一张lookup table, 然后以图像的灰度值作为索引,映射得到相应的颜色值.图像的灰度值是由图像本身决定的,但是lookup table 却可以各种各样,所以不同的lo ...
Oracle ERP系統借贷关系表
系统分步骤产生的分录: 1)库存模块作接收时产生的分录为: 借:材料采购 (采购单价X订单数量) 贷:应计负债 (采购单价X订单数量) 2)库存模块作检验入库时产生的分录为: 系统产生的分录分别为: ...
bash下如何使用bind[En]
You can determine the character sequence emitted by a key by pressing Ctrl-v at the command line, th ...
Lease问题
经过查明原来是lease引发的问题.不过查问题的过程让我们耽误了很多修复故障的时间,很是不爽. 起因:datanode和regionserver以及master同时挂掉现象:datanode重启后, ...
obj-c中-fobjc-arc-exceptions的解释
在开启ARC之后正常情况下一切和内存有关的申请和释放操作皆不用你关心了,ARC全全帮你包办了.但是还有极少数的情况下,编译器无法为你生成合适的ARC额外代码,比如obj-c异常就是这么一个例子. 话句 ...

Python-网站页面代码获取

Python-网站页面代码获取的更多相关文章

随机推荐

热门专题