python网络爬虫数据解析之正则

本节内容，讲解爬取网络图片，利用正则匹配图片地址

请求网页之后，响应部分内容如下图：

 1 时间：2023/1/7 10:42

 2 功能描述

 3 1.进行指定标签的定位

 4 2.标签或者标签对应的属性中存储的数据值进行提取（解析）

 5 获取图片地址并下载

 6

 7

 8 编码流程

 9 1.指定url

10 2.发起请求

11 3，数据解析

12 4.持久化存储

13

14 '''

15 import requests

16 import re   # 导入正则模块

17 import os   # 创建文件夹的时候使用

18 # 创建一个文件夹来保存下载的图片

19 if not os.path.exists('我的图片'):

20     os.mkdir('我的图片')

21 path = '我的图片'

22

23 url = 'https://www.7nua.com/nua/2022051081813.html'

24 headers= {'user-agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/108.0.0.0 Safari/537.36'}

25 # 发送请求并获取响应数据，响应数据是一个html文件

26 url_text = requests.get(url, headers=headers).text

27 # 正则匹配,需要保留的匹配数据，要用（）括起来。

28 # 正则表达式要用一对单引号括起来

29 r = '<p><img src="(.*?)">'

30 # 调用正则方法findall（），第一个参数为正则表达式，第二次参数为应用的数据源，第三个参数re.S表示多行匹配，re.M表示单行匹配，一般都写多行匹配

31 # 其返回值是一个列表,主要，这里返回的是相对地址，还有自己补完整

32 lis = re.findall(r, url_text, re.S)

33 # print(lis)

34 # 我们可以复制一下图片地址，看看其完整地址是什么，好补充

35 for src in lis:

36     src = '    https://www.7nua.com'+src

37     # 请求到了图片的二进制数据,所以用content，而不用text

38     img_data = requests.get(url=src, headers=headers).content

39     # 生成图片名称，用切片函数split(),第一个参数表示以‘/'为切割符，切割好之后，取这个列表的最后一个元素，用-1

40     # 对图片地址字符串src，调用切片函数split

41     img_name = src.split('/')[-1]

42     # 保存图片

43     with open('{}/{}'.format(path,img_name), 'wb')as fp:

44         fp.write(img_data)

45         print(img_name, '下载成功!!')

46     print('所以图片下载完成！')

python网络爬虫数据解析之正则的更多相关文章

Python网络爬虫数据解析的三种方式
request实现数据爬取的流程: 指定url 基于request发起请求获取响应的数据数据解析持久化存储 1.正则解析: 常用的正则回顾:https://www.cnblogs.com/wqz ...
python网络爬虫之解析网页的BeautifulSoup(爬取电影图片)[三]
目录前言一.BeautifulSoup的基本语法二.爬取网页图片扩展学习后记前言本章同样是解析一个网页的结构信息在上章内容中(python网络爬虫之解析网页的正则表达式(爬取4k动漫图 ...
python网络爬虫之解析网页的正则表达式(爬取4k动漫图片)[三]
前言 hello,大家好本章可是一个重中之重,因为我们今天是要爬取一个图片而不是一个网页或是一个json 所以我们也就不用用到selenium模块了,当然有兴趣的同学也一样可以使用selenium去 ...
070.Python聚焦爬虫数据解析
一聚焦爬虫数据解析 1.1 基本介绍聚焦爬虫的编码流程指定url 基于requests模块发起请求获取响应对象中的数据数据解析进行持久化存储如何实现数据解析三种数据解析方式正则表达式 ...
python网络爬虫数据中的三种数据解析方式
一.正则解析常用正则表达式回顾: 单字符: . : 除换行以外所有字符 [] :[aoe] [a-w] 匹配集合中任意一个字符 \d :数字 [0-9] \D : 非数字 \w :数字.字母.下划线 ...
python网络爬虫之解析网页的XPath(爬取Path职位信息)[三]
目录前言 XPath的使用方法 XPath爬取数据后言 @(目录) 前言本章同样是解析网页,不过使用的解析技术为XPath. 相对于之前的BeautifulSoup,我感觉还行,也是一个比较常用 ...
python网络爬虫-数据储存（七）
数据储存主要介绍两种数据储存方法: 储存在文件中,包括text文件和csv文件存储在数据库中,包括MySQL关系型数据库和mongoDB数据库存储到txt title = "第一个文本 ...
05 Python网络爬虫的数据解析方式
一.爬虫数据解析的流程 1.指定url 2.基于requests模块发起请求 3.获取响应中的数据 4.数据解析 5.进行持久化存储二.解析方法 (1)正则解析 (2)bs4解析 (3)xpath解 ...
python爬虫--数据解析
数据解析什么是数据解析及作用概念:就是将一组数据中的局部数据进行提取作用:来实现聚焦爬虫数据解析的通用原理标签定位取文本或者属性正则解析正则回顾单字符: . : 除换行以外所有字符 ...
《精通python网络爬虫》笔记
<精通python网络爬虫>韦玮著目录结构第一章什么是网络爬虫第二章爬虫技能概览第三章爬虫实现原理与实现技术第四章 Urllib库与URLError异常处理第五章正则 ...

随机推荐

一篇文章带你了解热门版本控制系统——Git
一篇文章带你了解热门版本控制系统--Git 这篇文章会介绍到关于版本控制的相关知识以及版本控制神器Git 我们可能在生活中经常会使用GitHub网页去查询一些开源的资源或者项目,GitHub就是基于G ...
uoj220【NOI2016】网格
刚了几个小时啊,这tm要是noi我怕不是直接滚粗了.我判答案为1的情况试了几种做法,最后终于想到了一个靠谱的做法,然后细节巨多,调了好久,刚拿到97分时代码有6.2KB了,后来发现有些东西好像没啥用就 ...
Error creating bean with name ‘com.ai.ecs.ecop.pointExchange.service.NewGoodsService‘
Error creating bean with name 'com.ai.ecs.ecop.pointExchange.service.NewGoodsService' 查看服务注册中心的格式是否正 ...
golang中的变量阴影
索引:https://waterflow.link/articles/1666019023270 在 Go 中,在块中声明的变量名可以在内部块中重新声明. 这种称为变量阴影的原理很容易出现常见错误. ...
SQL中的转义字符和通配符
一.通配符如果想查找"_cs"结尾的的账户 select * from [user] where loginname like '%_cs'是不行的, _ 被认为是任意的字 ...
Redis系列8：Bitmap实现亿万级数据计算
Redis系列1:深刻理解高性能Redis的本质 Redis系列2:数据持久化提高可用性 Redis系列3:高可用之主从架构 Redis系列4:高可用之Sentinel(哨兵模式) Redis系列5: ...
OpenFOAM 编程 | 求解捕食者与被捕食者模型（predator-prey model）问题（ODEs）
0. 写在前面本文问题参考自文献 \(^{[1]}\) 第一章例 6,并假设了一些条件,基于 OpenFOAM-v2206 编写程序数值上求解该问题.笔者之前也写过基于 OpenFOAM 求解偏分方 ...
C#中winform DataGridView常用修改点
1.修改列名一般情况下,从数据库里面读取的列名是英文或者拼音,但是,有时候显示需要中文,这样就需要修改列名了. dgv.Columns[0].HeaderCell.Value="编号&qu ...
Python 包（package）
在比较大型的项目中常常需要编写.用到大量的模块,此时我们可以使用包(Package)来管理这些模块. (一)什么是包? Python包,就是里面装了一个__init__.py文件的文件夹. __ini ...
【网络】安装Nginx笔记
目录前言安装前先更新下安装依赖库下载Nginx Nginx编译配置编译&安装&验证nginx Nginx服务配置配置SSL 参考前言 up安装nginx主要是为了在服务器 ...

python网络爬虫数据解析之正则

python网络爬虫数据解析之正则的更多相关文章

随机推荐

热门专题