Python 爬取陈都灵百度图片

标签（空格分隔）：随笔

今天意外发现了自己以前写的一篇爬虫脚本，爬取的是我的女神陈都灵，尝试运行了一下发现居然还能用。故把脚本贴出来分享一下。

import requests

import os

import json

#import random

#firsturl='https://image.baidu.com/search/acjson?'

#header={'User-Agent':'Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

def get_chenduling(le):

    header = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

    url = 'https://image.baidu.com/search/acjson?'

    data={'tn':'resultjson_com',

    'ipn':'rj',

    'ct':'201326592',

    'is':'',

    'fp':'result',

    'queryWord':'陈都灵',

    'cl':'2',

    'lm':'-1',

    'ie':'utf-8',

    'oe':'utf-8',

    'adpicid':'',

    'st':'',

    'z':'',

    'ic':'',

    'word':'陈都灵',

    's':'',

    'se':'',

    'tab':'',

    'width':'',

    'height':'',

    'face':'',

    'istype':'',

    'qc':'',

    'nc':'',

    'fr':'',

    'cg':'star',

    'pn':'30',

    'rn':'30',

    'gsm':le,

    }

    response=requests.get(url,params=data,headers=header)

    #print(response.text[:3000])

    chen=json.loads(response.text)

   #

    if chen and 'data' in chen:

        for item in chen.get('data'):

            newurl=item.get('middleURL')

            #print(newurl)

            if newurl:

                dd=savechen(newurl,header)

                resave(newurl,dd)

    nextle=chen.get('gsm')

    #print(nextle)

    get_chenduling(nextle)

def savechen(item,header):

    try:

        dudu=requests.get(item,headers=header)

        dudu.raise_for_status()

        #fpath='{0}.{1}.{2}'.format('d:\chenduling\\',item.split('.')[-2],'jpg')

        return dudu.content

    except:

        print('有毛病。。。。')

def resave(item,html):

    fpath = '{0}.{1}'.format('d:\chenduling', item.split(',')[-1])

    if not os.path.exists(fpath):

        with open (fpath,'wb') as ff:

            print('downloading.....{0}'.format(item))

            ff.write(html)

def main():

    le='le'

    #firsturl = 'https://image.baidu.com/search/acjson?'

    #header = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}

    get_chenduling(le)

if __name__ =='__main__':

    main()

运行了一下，一点问题都没有，图片都存放到D盘了，拓展到其他图片估计也没问题，至于le这个参数干嘛的，我也记不清了。隐约记得有一个请求头部包含一串数字，但是这串数字并没有卵用。

Python 爬取陈都灵百度图片的更多相关文章

python爬取某个网页的图片-如百度贴吧
python爬取某个网页的图片-如百度贴吧作者:vpoet mail:vpoet_sir@163.com 注:随意copy,不用告诉我 #coding:utf-8 import urllib imp ...
python爬取某个网站的图片并保存到本地
python爬取某个网站的图片并保存到本地 #coding:utf- import urllib import re import sys reload(sys) sys.setdefaultenco ...
Python爬取 | 唯美女生图片
这里只是代码展示,且复制后不能直接运行,需要配置一些设置才行,具体请查看下方链接介绍: Python爬取 | 唯美女生图片 from selenium import webdriver from fa ...
【Python网络爬虫四】通过关键字爬取多张百度图片的图片
最近看了女神的新剧<逃避虽然可耻但有用>,同样男主也是一名程序员,所以很有共鸣被大只萝莉萌的一脸一脸的,我们来爬一爬女神的皂片. 百度搜索结果:新恒结衣本文主要分为4个部分: 1.下载 ...
python爬取网页文本、图片
从网页爬取文本信息: eg:从http://computer.swu.edu.cn/s/computer/kxyj2xsky/中爬取讲座信息(讲座时间和讲座名称) 注:如果要爬取的内容是多页的话,网址 ...
python: 爬取[博海拾贝]图片脚本
练手代码,聊作备忘: # encoding: utf-8 # from __future__ import unicode_literals import urllib import urllib2 ...
python 爬取全量百度POI
在网上找了很多关于爬取百度POI的文章,但是对“全量”的做法并没有得到最终的解决方案,自己写了一个,但还是不能实现全量POI抓取,能够达到至少50%的信息抓取.注意:这里所指“全量”是能够达到100% ...
Python爬取mn52网站美女图片以及图片防盗链的解决方法
防盗链原理 http标准协议中有专门的字段记录referer 一来可以追溯上一个入站地址是什么二来对于资源文件,可以跟踪到包含显示他的网页地址是什么因此所有防盗链方法都是基于这个Referer字段 ...
python爬取并批量下载图片
import requests from lxml import etree url='http://desk.zol.com.cn/meinv/' add1='.html' urls=[] i = ...

随机推荐

LeetCode 721. Accounts Merge
原题链接在这里:https://leetcode.com/problems/accounts-merge/ 题目: Given a list accounts, each element accoun ...
WinDbg常用命令系列---!handle
!handle 简介 !handle扩展显示有关目标系统中一个或所有进程拥有的一个或多个句柄的信息. 使用形式用户模式!handle [Handle [UMFlags [TypeName]]] !h ...
nexus 3.17.0 简单试用
老样子,使用docker-compose 运行环境准备 docker-compose 文件 version: "3" services: nexus: image: sonaty ...
TCP BBR 从开启到关闭：以 Debian 9 为例
TCP BBR 从开启到关闭:以 Debian 9 为例开启执行如下命令: echo "net.core.default_qdisc=fq" >> /etc/sys ...
(13)Go接口
接口(interface)定义了一个对象的行为规范,只定义规范不实现,由具体的对象来实现规范的细节. 接口接口类型在Go语言中接口(interface)是一种类型,一种抽象的类型. interfa ...
微信小程序 base64格式图片的显示及保存
当我们拿到如下base64格式的图片(如下图)时, base64格式的图片数据: 如何显示 ? 使用image标签,src属性添加data:image/png;base64, (注意:若imgData ...
Intellij IDEA 自动清除无效 import 和清除无效 import 的快捷键
可以settings-general-auto import-java项,勾选optimize imports on the fly,在当前项目下会自动清除无效的import,而且这个是随时自动清除的 ...
Linux 上配置 AG
SQL Server Always On Availability Group 配置步骤:配置三台 Linux 集群节点创建 Availability Group配置 Cluster Resource ...
MongoDB 索引和 explain 的使用
索引基本使用索引是对数据库表中一列或多列的值进行排序的一种结构,可以让我们查询数据库变得更快.MongoDB 的索引几乎与传统的关系型数据库一模一样,这其中也包括一些基本的查询优化技巧. 首先我 ...
jmap -heap 查看堆内存
概述用jmap -heap命令可以查看linux堆内存分布具体用法 1:先查出tomcat的进程号例如: 然后执行 jmap -heap 7095 可以打印出整体的堆信息可以看到经过分配的 ...

Python 爬取陈都灵百度图片

Python 爬取陈都灵百度图片

Python 爬取陈都灵百度图片的更多相关文章

随机推荐

热门专题