手动爬虫之京东笔记本栏（ptyhon3）

 import urllib.request as ur

 import urllib.error as ue

 import re

 # 目标网址

 url = 'https://list.jd.com/list.html?cat=670,671,672'

 # 存放路径

 save_path = 'E:/workspace/PyCharm/codeSpace/books/python_web_crawler_book/chapter6/demo1/images/'

 # 代理服务器ip

 proxy_add = '115.174.66.148:8118'

 def get_JD_pictures(url, save_path, proxy_add, page):

     # 根据页面设置url

     url = url+"&page="+str(page)

     # 添加报头

     req = ur.Request(url)

     req.add_header('User-Agent', 'Mozilla/5.0 (Windows NT 10.0; WOW64; rv:52.0) Gecko/20100101 Firefox/52.0')

     # 设置代理

     proxy = ur.ProxyHandler({'http': proxy_add})

     opener = ur.build_opener(proxy, ur.HTTPHandler)

     ur.install_opener(opener)

     # 爬取页面

     info = ur.urlopen(req).read()

     # 信息存档

     info = str(info)

     pattern_1 = '<div id="plist".+? <div class="page clearfix">'

     info = re.compile(pattern=pattern_1).findall(info)

     info = info[]

     pattern_2 = '<img width="220" height="220" data-img="1" src="//(.+?\.jpg)">'

     image_list = re.compile(pattern=pattern_2).findall(info)

     x =

     for image_url in image_list:

         image_name = save_path+str(page)+"_"+str(x)+".jpg"

         image_url = "http://"+image_url

         try:

             ur.urlretrieve(image_url, filename=image_name)

         except ue.HTTPError as e:

             if hasattr(e, 'code'):

                 print(e.code)

             if hasattr(e, 'reason'):

                 print(e.reason)

         except ue.URLError as e:

             if hasattr(e, 'code'):

                 print(e.code)

             if hasattr(e, 'reason'):

                 print(e.reason)

         x += 

 get_JD_pictures(url, save_path, proxy_add, )

手动爬虫之京东笔记本栏（ptyhon3）的更多相关文章

手动爬虫之流程笔记1(python3)
一.引入拓展库由于刚刚起步学习爬虫,故从urllib库开始首先引入urllib,这里主要用到urllib中request类 import urllib.request as ur 二.设置全局参数 ...
Ubuntu下配置python完成爬虫任务（笔记一）
Ubuntu下配置python完成爬虫任务(笔记一) 目标: 作为一个.NET汪,是时候去学习一下Linux下的操作了.为此选择了python来边学习Linux,边学python,熟能生巧嘛. 前期目 ...
Scrapy爬虫大战京东商城
Scrapy爬虫大战京东商城引言上一篇已经讲过怎样获取链接,怎样获得参数了,详情请看python爬取京东商城普通篇代码详解首先应该构造请求,这里使用scrapy.Request,这个方法默认调 ...
scrapy爬虫框架学习笔记(一)
scrapy爬虫框架学习笔记(一) 1.安装scrapy pip install scrapy 2.新建工程: (1)打开命令行模式 (2)进入要新建工程的目录 (3)运行命令: scrapy sta ...
手动爬虫之淘宝笔记本栏（ptyhon3）
1.这次爬虫用到了之前封装的Url_ProxyHelper类,源代码如下 import urllib.request as ur class Url_ProxyHelper: def __init__ ...
手动爬虫之糗事百科（ptyhon3）
一.调用封装的Url_ProxyHelper类,源码如下 import urllib.request as ur class Url_ProxyHelper: def __init__(self, u ...
Python网络爬虫与信息提取笔记
直接复制粘贴笔记发现有问题文档下载地址//download.csdn.net/download/hide_on_rush/12266493 掌握定向网络数据爬取和网页解析的基本能力常用的 Pytho ...
《用Python写爬虫》学习笔记（二）编写第一个网络爬虫
1.首先,下载网页使用Python的urllib2模块,或者Python HTTP模块request来实现 urllib2会出现问题,解决方法1.重试下载(设置下载次数) 2.设置用户代理 2.其次, ...
《用Python写爬虫》学习笔记（一）
注:纯文本内容,代码独立另写,属于本人学习总结,无任何商业用途,在此分享,如有错误,还望指教. 1.为什么需要爬虫? 答:目前网络API未完全放开,所以需要网络爬虫知识. 2.爬虫的合法性? 答:爬虫 ...

随机推荐

WebDev.WebServer.exe，IIS ，IIS Express
调试ASP.NET程序的服务器有三种WebDev.WebServer.exe,IIS ,IIS Express,以下是从网上整理的他们各自的优缺点,记录以备查阅 1.ASP.NET开发服务器--Cas ...
Strace--系统调用分析问题集锦
---------------------------------------------------------------------------------------------------- ...
mysql-multi source replication 配置
1.关键步骤 change master to master_host='172.16.192.201', master_port, master_user='repl', master_passwo ...
unity, OnTriggerEnter2D不触发
我两个物体A,B都添加了Circle Collider 2D,并且都勾选了is Trigger,我在A的脚本里用void OnTriggerEnter2D(Collider2D coll)检测碰撞,但 ...
Vivado使用技巧：封装自己设计的IP核
概述 Vivado在设计时可以感觉到一种趋势,它鼓励用IP核的方式进行设计.“IP Integrator”提供了原理图设计的方式,只需要在其中调用设计好的IP核连线.IP核一部分来自于Xilinx ...
LFCS 系列第八讲：管理用户和用户组、文件权限和属性以及启用账户 sudo 访问权限
由于 Linux 是一个多用户的操作系统(允许多个用户通过不同主机或者终端访问一个独立系统),因此你需要知道如何才能有效地管理用户:如何添加.编辑.禁用和删除用户账户,并赋予他们足以完成自身任务的必要 ...
java中的Closeable接口
一.概述该接口位于java.io包下,声明例如以下:public interface Closeable Closeable 是能够关闭的数据源或目标. 调用 close 方法可释放对象保存的资源( ...
操作XmlDocument时，出现"System.OutOfMemoryException"异常，如何解决加载大数据的情况？
System.OutOfMemoryException: Exception of type 'System.OutOfMemoryException' was thrown.at System.St ...
最纯粹的直播技术实战02-Camera的处理以及推流
最纯粹的直播技术实战02-Camera的处理以及推流最新实战教程.Android自己主动化刷量.作弊与防作弊.案例:刷友盟统计.批量注冊苹果帐号这个系列的文章将会研究最纯粹的Android直播的实 ...
VS2017 Use Git Push To TFS2018 Failure
先上图: 提示信息很明确,认证失败!! 在使用TFS2018 建立Git Repo 的时候,有一句提示,如果遇到权限问题,请升级Git,我本地Git已经是最新版本,并且在环境变量中,如下图经过分析觉 ...

手动爬虫之京东笔记本栏（ptyhon3）

手动爬虫之京东笔记本栏（ptyhon3）的更多相关文章

随机推荐

热门专题