使用python爬取百度贴吧内的图片

1. 首先通过urllib获取网页的源码

# 定义一个getHtml()函数

def getHtml(url):

    try:

        page = urllib.urlopen(url)  # urllib.urlopen()方法用于打开一个URL地址

        html = page.read()  # read()方法用于读取URL上的数据

    except Exception as e:

        html = ''

    return html

2. 获取下一页的url链接，当本页的图片链接获取完毕，再继续获取下一页的。使用Python正则表达式匹配需要的字段

# 得到下一页的url

def get_page_url(html):

    url_reg = r'<a href="(.*)">下一页</a>'

    url_pattern = re.compile(url_reg)

    fanye_urls = url_pattern.findall(html)

    fanye_url = 'https://tieba.baidu.com' + fanye_urls[0] if fanye_urls else ''

    return fanye_url

3. 获取每一页的图片链接，将之放入一个总的数组，最后通过链接下载图片

def getImg(html):

    img_reg = r'https://.[^\s]+?.jpg|https://.[^\s]+?.png'  # 正则表达式，得到图片地址

    img_pattern = re.compile(img_reg)  # re.compile() 可以把正则表达式编译成一个正则表达式对象.

    imgList = img_pattern.findall(html)  # img_pattern.findall() 方法读取html 中包含 img_reg（正则表达式）的  数据，数组形式

    return imgList

4. 下载图片。使用urllib.urlretrieve()方法，直接根据链接将图片下载到本地

def down_img(imgList):

    x = 0

    for imgUrl in imgList:

        try:

            # 核心是urllib.urlretrieve()方法,直接将远程数据下载到本地，图片通过x依次递增命名

            urllib.urlretrieve(imgUrl, 'E:\img\%s.jpg' % str(x + 1))

            print '成功下载第%s张图片时：%s' % (str(x + 1), str(imgUrl))

            x += 1

        except Exception as e:

            print '下载第%s张图片时失败：%s' % (str(x + 1), str(imgUrl))

            print e

            continue

    return imgList

5. 先爬取第一页的图片链接，然后通过while循环，继续读取第二页，.....，等到最后，将所有从网上爬取的图片链接使用extend()方法放入总的数组内，然后统一下载

all_img_urls = []

    # 得到网页源码

    html = getHtml("https://tieba.baidu.com/p/5407739329")

    fanye_url = get_page_url(html)

    # 得到图片链接的数组

    imgList = getImg(html)

    # 将imgList数组存入总的图片数组内

    all_img_urls.extend(imgList)

    fanye_count = 0  # 累计翻页数

    while 1:

        try:

            next_html = getHtml(fanye_url)

            fanye_url = get_page_url(next_html)

            next_imgList = getImg(next_html)

            fanye_count += 1

            print('第%s页' % fanye_count)

            all_img_urls.extend(next_imgList)

            if fanye_url == '' and next_imgList == []:

                print('已到最后一页, 开始下载：')

                break

        except Exception as e:

            print e

            continue

    down_img(all_img_urls)

总的代码如下：

# coding=utf-8

"""下载百度贴吧内的图片"""

import re

import urllib

# 定义一个getHtml()函数

def getHtml(url):

    try:

        page = urllib.urlopen(url)  # urllib.urlopen()方法用于打开一个URL地址

        html = page.read()  # read()方法用于读取URL上的数据

    except Exception as e:

        html = ''

    return html

# 得到下一页的url

def get_page_url(html):

    url_reg = r'<a href="(.*)">下一页</a>'

    url_pattern = re.compile(url_reg)

    fanye_urls = url_pattern.findall(html)

    fanye_url = 'https://tieba.baidu.com' + fanye_urls[0] if fanye_urls else ''

    return fanye_url

def getImg(html):

    img_reg = r'https://.[^\s]+?.jpg|https://.[^\s]+?.png'  # 正则表达式，得到图片地址

    img_pattern = re.compile(img_reg)  # re.compile() 可以把正则表达式编译成一个正则表达式对象.

    imgList = img_pattern.findall(html)  # img_pattern.findall() 方法读取html 中包含 img_reg（正则表达式）的  数据，数组形式

    return imgList

def down_img(imgList):

    x = 0

    for imgUrl in imgList:

        try:

            # 核心是urllib.urlretrieve()方法,直接将远程数据下载到本地，图片通过x依次递增命名

            urllib.urlretrieve(imgUrl, 'E:\img\%s.jpg' % str(x + 1))

            print '成功下载第%s张图片时：%s' % (str(x + 1), str(imgUrl))

            x += 1

        except Exception as e:

            print '下载第%s张图片时失败：%s' % (str(x + 1), str(imgUrl))

            print e

            continue

    return imgList

if __name__ == '__main__':

    all_img_urls = []

    # 得到网页源码

    html = getHtml("https://tieba.baidu.com/p/5407739329")

    fanye_url = get_page_url(html)

    # 得到图片链接的数组

    imgList = getImg(html)

    # 将imgList数组存入总的图片数组内

    all_img_urls.extend(imgList)

    fanye_count = 0  # 累计翻页数

    while 1:

        try:

            next_html = getHtml(fanye_url)

            fanye_url = get_page_url(next_html)

            next_imgList = getImg(next_html)

            fanye_count += 1

            print('第%s页' % fanye_count)

            all_img_urls.extend(next_imgList)

            if fanye_url == '' and next_imgList == []:

                print('已到最后一页, 开始下载：')

                break

        except Exception as e:

            print e

            continue

    down_img(all_img_urls)

使用python爬取百度贴吧内的图片的更多相关文章

Python——爬取百度百科关键词1000个相关网页
Python简单爬虫——爬取百度百科关键词1000个相关网页——标题和简介网站爬虫由浅入深:慢慢来分析: 链接的URL分析: 数据格式: 爬虫基本架构模型: 本爬虫架构: 源代码: # codin ...
python 爬取百度url
#!/usr/bin/env python # -*- coding: utf-8 -*- # @Date : 2017-08-29 18:38:23 # @Author : EnderZhou (z ...
python爬取百度贴吧帖子
最近偶尔学下爬虫,放上第二个demo吧 #-*- coding: utf-8 -*- import urllib import urllib2 import re #处理页面标签类 class Too ...
爬虫实战(一) 用Python爬取百度百科
最近博主遇到这样一个需求:当用户输入一个词语时,返回这个词语的解释我的第一个想法是做一个数据库,把常用的词语和词语的解释放到数据库里面,当用户查询时直接读取数据库结果但是自己又没有心思做这样一个数 ...
假期学习【十一】Python爬取百度词条写入csv格式 python 2020.2.10
今天主要完成了根据爬取的txt文档,从百度分类从信息科学类爬取百度词条信息,并写入CSV格式文件. txt格式文件如图: 为自己爬取内容分词后的结果. 代码如下: import requests fr ...
python爬取百度搜索结果ur汇总
写了两篇之后,我觉得关于爬虫,重点还是分析过程分析些什么呢: 1)首先明确自己要爬取的目标比如这次我们需要爬取的是使用百度搜索之后所有出来的url结果 2)分析手动进行的获取目标的过程,以便以程序 ...
Python 爬虫练习：爬取百度贴吧中的图片
背景:最近开始看一些Python爬虫相关的知识,就在网上找了一些简单已与练习的一些爬虫脚本实现功能:1,读取用户想要爬取的贴吧 2,读取用户先要爬取某个贴吧的页数范围 3,爬取每个贴吧中用户输入的页 ...
python 爬取百度云资源
pan1 1 import urllib.request 2 import re 3 import random 4 5 def get_source(key): 6 7 print('请稍等,爬取中 ...
python爬取百度翻译返回：{'error': 997, 'from': 'zh', 'to': 'en', 'query 问题
解决办法: 修改url为手机版的地址:http://fanyi.baidu.com/basetrans User-Agent也用手机版的测试代码: # -*- coding: utf-8 -*- & ...

随机推荐

Android短视频SDK转码实践
一. 前言一些涉及的基本概念: 转码:一般指多媒体文件格式的转换,比如分辨率.码率.封装格式等: 解复用(demux):从某种封装中分离出视频track和音频track,然后交给后续模块进行处理: ...
iOS学习——iOS 整体框架及类继承框架图
整理自:IOS 整体框架类图值得收藏一整体框架在iOS开发过程中,对iOS的整理框架的了解和学习是必不可少的一个环节,今天我们就好好来了解一下iOS的整体框架.首先贴一个关于iOS的框架介绍:i ...
angular4.0项目文件解读
这篇文章我觉得是很有用的,便于我们对ng项目的理解,同时在配置项目时,也能够很快的定位到相应文件. 摘录的别人的文章,首先感谢那个路人兄弟,下面就开始学习吧. File 文件 Purpose 用途 e ...
css条纹背景
一. 水平条纹 1. 两种颜色: html <div class="stripe"></div> css .stripe{ width: 250px; he ...
iOS性能优化技术
小小总结,后续继续跟进. 1. 提高应用性能的几个开发细节 * 尽量避免使用constraint实现动画 * 尽量避免使用数组的删除操作 * 尽量避免使用 NSString::stringWithFo ...
Python爬虫下载美女图片（不同网站不同方法）
声明:以下代码,Python版本3.6完美运行一.思路介绍不同的图片网站设有不同的反爬虫机制,根据具体网站采取对应的方法 1. 浏览器浏览分析地址变化规律 2. Python测试类获取网页内容,从 ...
wifipineapple插件：codeInject的使用
如果在中间人攻击的时候, 能在用户的网页中插入任意代码, 可以说已经完成一半了 wifipineapple有个codeInject插件, 可以让连上这个网络所有设备浏览网页的时候, 在网页中插入任意h ...
Redis 部署主从哨兵 C#使用,实现自动获取redis缓存实例2
资料查找https://www.cnblogs.com/tdws/p/5836122.html https://www.cnblogs.com/lori/p/5794454.html private ...
golang 类型断言的学习
在php中有一个 serialize() 函数可以把数组序列化成字符串进行存储和传输如果想反序列化这种字符串,在php中只需要一个简单的unserialize() 函数就可以完成了.但是在gola ...
Vijos-P1057题解
题目如下: https://www.vijos.org/p/1057 思路分析: 输入文件第一行为两个整数n,m(1<=n,m<=1000),接下来n行,每行m个数字,用空格隔开.0表示该 ...

使用python爬取百度贴吧内的图片

使用python爬取百度贴吧内的图片的更多相关文章

随机推荐

热门专题