爬当当网上python书籍的图片

1.分析网页代码，获取图片下载连接：http://img3m4.ddimg.cn/20/11/23473514-1_b_5.jpg

2. python实现代码

 import os

 import re

 import requests

 import time

 # 图片来源url

 url='http://search.dangdang.com/?key=python&act=input'

 # 构建请求头

 headers = {

     'User-Agent':'Mozilla/5.0 (Linux; Android 6.0; Nexus 5 Build/MRA58N) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.79 Mobile Safari/537.36'

 }

 # 获取网页HTML代码

 response = requests.get(url=url,headers=headers)

 html = response.text

 # print(html)

 # 抓取图片名称

 pic_name = re.findall('<a title=" (.*?)"  ddclick',html)

 # print(pic_name)

 # 抓取图片url

 pic_url = re.findall("<img src='(.*?)' alt",html)

 pic_url2 = re.findall("<img data-original='(.*?)' src",html)

 pic_url.extend(pic_url2)  # 把两个list合并起来

 # 创建文件夹

 base_path = os.getcwd()#获取当前文件的绝对路劲

 file_name = r'爬图片'#存放图片的文件夹名称

 path = os.path.join(base_path,file_name)

 if os.path.exists(path):#判断文件夹是否存在，不存在则创建一个名为file_name的文件夹

     pass

 else:

     os.mkdir(path)

 # 把图片保存起来

 for i in range(len(pic_url)):

     rsp = requests.get(pic_url[i])

     # 创建图片名称

     img = pic_name[i]+'.jpg'

     img_name = os.path.join(path,img)

     with open(img_name,'wb')as f:

         f.write(rsp.content)

         time.sleep(1)

         print("正在下载第{}张图片".format(i))

爬当当网上python书籍的图片的更多相关文章

python爬取当当网的书籍信息并保存到csv文件
python爬取当当网的书籍信息并保存到csv文件依赖的库: requests #用来获取页面内容 BeautifulSoup #opython3不能安装BeautifulSoup,但可以安装Bea ...
python连续爬取多个网页的图片分别保存到不同的文件夹
python连续爬取多个网页的图片分别保存到不同的文件夹作者:vpoet mail:vpoet_sir@163.com #coding:utf-8 import urllib import ur ...
Python爬取豆瓣指定书籍的短评
Python爬取豆瓣指定书籍的短评 #!/usr/bin/python # coding=utf-8 import re import sys import time import random im ...
Python爬取网上车市[http://www.cheshi.com/]的数据
#coding:utf8 #爬取网上车市[http://www.cheshi.com/]的数据 import requests, json, time, re, os, sys, time,urlli ...
利用python爬取王者荣耀英雄皮肤图片
前两天看到同学用python爬下来LOL的皮肤图片,感觉挺有趣的,我也想试试,于是决定来爬一爬王者荣耀的英雄和皮肤图片. 首先,我们找到王者的官网http://pvp.qq.com/web201605 ...
Python 爬取煎蛋网妹子图片
#!/usr/bin/env python # -*- coding: utf-8 -*- # @Date : 2017-08-24 10:17:28 # @Author : EnderZhou (z ...
初识python 之爬虫：爬取某网站的壁纸图片
用到的主要知识点:requests.get 获取网页HTMLetree.HTML 使用lxml解析器解析网页xpath 使用xpath获取网页标签信息.图片地址request.urlretrieve ...
Python爬取贴吧中的图片
#看到贴吧大佬在发图,准备盗一下 #只是爬取一个帖子中的图片 1.先新建一个scrapy项目 scrapy startproject TuBaEx 2.新建一个爬虫 scrapy genspider ...
python 将png图片格式转换生成gif动画
先看知乎上面的一个连接用Python写过哪些[脑洞大开]的小工具? https://www.zhihu.com/question/33646570/answer/157806339 这个哥们通过爬气 ...

随机推荐

Httpwatch教程
启动Httpwatch 从IE的“查看”—“浏览器栏”—“HttpWatch”启动HttpWatch.如下图所示: 以下是HttpWatch程序界面以下用登录我的邮箱mail.163.com例子来展 ...
thinkphp5.1路由设置小计
route下定义路由路径,如果是这种情况 'product'=>'home/product/index',//产品信息首页 'product/list'=>'home/product/li ...
python — 函数基础知识(一)
目录 1 面向过程编程与函数式编程 2 函数的基本结构 3 函数的参数 1 面向过程编程与函数式编程截至目前我们所接触.所写的编程为:面向过程式编程[可读性差/可重用性差] # 面向过程编程 use ...
RBAC授权
RBAC RBAC使用rbac.authorization.k8s.io API Group 来实现授权决策,允许管理员通过 Kubernetes API 动态配置策略,要启用RBAC,需要在 api ...
图像识别tesseract-ocr
下载地址 https://github.com/tesseract-ocr/tesseract/wiki/Data-Files. https://github.com/tesseract-ocr/te ...
图数据库-Neo4j-初探
图数据库-Neo4j-初探 2018-08-17 本次初探主要学习如何安装Neo4j,以及Cypher的基本语法. 1. 安装Neo4j Desktop版本 neo4j-desktop Server版 ...
C# Extension Methods（C#类方法扩展）
使用Extension methods 可以在已有的类型(types)中添加方法(Methods),而无需通过增加一种新的类型或修改已有的类型. 比如说,想要给string类型增加一个PrintStr ...
C# 关键字 virtual、override和new的用法
代码如下: class A { public void foo() { Console.WriteLine("A::foo()"); } public virtual void b ...
浅谈nginx简介和应用场景
简介 nginx是一款轻量级的web服务器,它是由俄罗斯的程序设计师伊戈尔·西索夫所开发. nginx相比于Tomcat性能十分优秀,能够支撑5w的并发连接(而Tomcat只能支撑200-400),并 ...
2-1 bash基本特性
bash基本特性 bash基本介绍 bash是shell的一种,shell是计算机与用户交互的主要接口,狭义上的shell指的是CLI(command line interface命令行接口),用户输 ...

爬当当网上python书籍的图片

爬当当网上python书籍的图片的更多相关文章

随机推荐

热门专题