re模块常用函数

1. findall() 函数　

 find('正则表达式'，‘待匹配的字符串’)  #返回匹配到字符串，并存放在列表中

　　详解见：https://www.cnblogs.com/nbk-zyc/p/11113328.html

 import re

 ret = re.findall('www.(baidu|oldboy).com', 'www.oldboy.com')

 print(ret)  # ['oldboy']     这是因为findall会优先把匹配结果组里内容返回,如果想要匹配结果,取消权限即可

 ret = re.findall('www.(?:baidu|oldboy).com', 'www.oldboy.com')

 print(ret)  # ['www.oldboy.com']

练习 findall() 与分组

2. search() 函数

 import re

 ret = re.search('abc', 'this is abcABC').group()

 print(ret) #结果 : 'abc'

 # 函数会在字符串内按规则匹配,当找到第一个匹配结果时就结束查找，然后返回一个包含匹配信息的对象,该对象可以 通过   调用group()方法   得到匹配的字符串,

 # 如果没有匹配到字符串，则返回None

 obj = re.compile('\d{3}')  #将正则表达式编译成为一个 正则表达式对象，规则要匹配的是3个数字

 ret = obj.search('abc123eeee') #正则表达式对象调用search，参数为待匹配的字符串

 print(ret.group())  #结果 ： 123

3. match() 函数

 import re

 ret = re.match('this', 'this is abcABC').group()

 print(ret) #结果 : 'this'

 # 在字符串开始处 就按规则匹配，其它 与search()函数使用方法一样

4 finditer() 函数

 import re

 ret = re.finditer('\d', 'ds3sy4784a')   #finditer返回一个存放匹配结果的迭代器

 print(ret)  # <callable_iterator object at 0x10195f940>

 print(next(ret).group())  #查看第一个结果  '3'

 print(next(ret).group())  #查看第二个结果  '4'

 print([i.group() for i in ret])  #查看剩余的匹配结果 ['7', '8', '4']

5 sub() 和 subn() 函数

 import re

 ret = re.sub('\d', 'H', 'eva3egon4yuan4', 1)#将数字替换成'H'，参数1表示只替换1个

 print(ret) #evaHegon4yuan4

 ret = re.subn('\d', 'H', 'eva3egon4yuan4')

 print(ret)

 #将数字替换成'H'，返回元组(替换的结果,替换了多少次),即('evaHegonHyuanH', 3)

6 split() 函数

 ret = re.split('[ab]', 'abcd')  # 先按'a'分割得到''和'bcd',在对''和'bcd'分别按'b'分割

 print(ret)  # ['', '', 'cd']

 ret=re.split("\d+","eva3egon4yuan")

 print(ret) #结果 ： ['eva', 'egon', 'yuan']

 ret=re.split("(\d+)","eva3egon4yuan")

 print(ret) #结果 ： ['eva', '3', 'egon', '4', 'yuan']

 #在匹配部分加上（）之后所切出的结果是不同的，

 #没有（）的没有保留所匹配的项，但是有（）的却能够保留了匹配的项，

 #这个在某些需要保留匹配部分的使用过程是非常重要的。

练习-split() 与分组

扩展练习

 ret = re.search("<(?P<tag_name>\w+)>\w+</(?P=tag_name)>","<h1>hello</h1>")

 #还可以在分组中利用 ?P<name>的形式给分组起名字

 #获取的匹配结果可以直接用group('名字')拿到对应的值

 print(ret.group('tag_name'))  #结果 ：h1

 print(ret.group())  #结果 ：<h1>hello</h1>

 ret = re.search(r"<(\w+)>\w+</\1>","<h1>hello</h1>")

 #如果不给组起名字，也可以用  \序号   来找到对应的组，表示要找的内容和前面的组内容一致

 #获取的匹配结果可以直接用group(序号)拿到对应的值

 print(ret.group(1)) #结果 ：h1

 print(ret.group())  #结果 ：<h1>hello</h1>

匹配标签

 import re

 #匹配数字

 ret=re.findall(r"\d+","1-2*(60+(-40.35/5)-(-4*3))")

 print(ret) #['1', '2', '60', '40', '35', '5', '4', '3']

 #匹配整数

 ret=re.findall(r"-?\d+\.\d*|(-?\d+)","1-2*(60+(-40.35/5)-(-4*3))")

 print(ret) #['1', '-2', '60', '', '5', '-4', '3']

 ret.remove("")

 print(ret) #['1', '-2', '60', '5', '-4', '3']

 #匹配实数

 ret=re.findall(r"-?\d+\.\d*|-?\d+","1-2*(60+(-40.35/5)-(-4*3))")

 print(ret) #['1', '-2', '60', '-40.35', '5', '-4', '3']

匹配数字/整数/实数

 import re

 from urllib.request import urlopen

 def getPage(url):

     response = urlopen(url)

     return response.read().decode('utf-8')

 def parsePage(s):

     ret = re.findall(

         '<div class="item">.*?'

         '<div class="pic">.*?'

         '<em .*?>'

         '(?P<id>\d+).*?'

         '<span class="title">(?P<title>.*?)</span>.*?'

         '<span class="rating_num" .*?>(?P<rating_num>.*?)</span>.*?'

         '<span>(?P<comment_num>.*?)评价</span>',s,re.S)

     return ret

 def main(num):

     url = 'https://movie.douban.com/top250?start=%s&filter=' % num    # %s标记每页的首条信息

     response_html = getPage(url)    #获取网页的全部内容

     ret = parsePage(response_html) #解析所需求的信息

     print(ret)

 count = 0

 for i in range(10):   # 10页

     main(count)

     count += 25        # 每页25条信息

爬取网页-简单版

 from urllib.request import urlopen

 import re

 import json

 def getPage(url):

     response = urlopen(url)

     return response.read().decode('utf-8')

 def parsePage(s):

     com = re.compile(

         '<div class="item">.*?'

         '<div class="pic">.*?'

         '<em .*?>'

         '(?P<id>\d+).*?'

         '<span class="title">(?P<title>.*?)</span>.*?'

         '<span class="rating_num" .*?>(?P<rating_num>.*?)</span>.*?'

         '<span>(?P<comment_num>.*?)评价</span>', re.S)

     ret = com.finditer(s)   # finditer返回一个存放匹配结果的迭代器

     for i in ret:

         yield {

             "id": i.group("id"),

             "title": i.group("title"),

             "rating_num": i.group("rating_num"),

             "comment_num": i.group("comment_num"),

         }

 def main(num):

     url = 'https://movie.douban.com/top250?start=%s&filter=' % num

     response_html = getPage(url)

     ret = parsePage(response_html)

     #print(ret)

     f = open("move_info7", "a", encoding="utf-8")

     for obj in ret:

         print(obj)

         data = json.dumps(obj, ensure_ascii=False)

         f.write(data + "\n")

     f.close()

 if __name__ == '__main__':

     count = 0

     for i in range(10):

         main(count)

         count += 25

爬取网页-完整版

re模块常用函数的更多相关文章

AR模块常用函数
--AR模块常用函数 FUNCTION get_fnd_user_name ( p_user_id IN NUMBER ) return VARCHAR2 IS CURSOR c_user_name ...
$python正则表达式系列（2）——re模块常用函数
本文主要介绍正则re模块的常用函数. 1. 编译正则 import re p = re.compile(r'ab*') print '[Output]' print type(p) print p p ...
python重要的第三方库pandas模块常用函数解析之DataFrame
pandas模块常用函数解析之DataFrame 关注公众号"轻松学编程"了解更多. 以下命令都是在浏览器中输入. cmd命令窗口输入:jupyter notebook 打开浏览器 ...
pandas模块常用函数解析之Series（详解）
pandas模块常用函数解析之Series 关注公众号"轻松学编程"了解更多. 以下命令都是在浏览器中输入. cmd命令窗口输入:jupyter notebook 打开浏览器输入网 ...
random模块常用函数
random模块常用函数: from random import * # Random float: 0.0 <= x < 1.0 random() # Random float: 2.5 ...
numpy.random模块常用函数解析
numpy.random模块中常用函数解析 numpy.random模块官方文档 1. numpy.random.rand(d0, d1, ..., dn)Create an array of the ...
Python OS模块常用函数说明
Python的标准库中的os模块包含普遍的操作系统功能.如果你希望你的程序能够与平台无关的话,这个模块是尤为重要的.即它允许一个程序在编写后不需要任何改动,也不会发生任何问题,就可以在Linux和Wi ...
numpy模块常用函数解析
https://blog.csdn.net/lm_is_dc/article/details/81098805 numpy模块以下命令都是在浏览器中输入. cmd命令窗口输入:jupyter note ...
sys模块常用函数
sys模块是和python解释器打交道的 sys.argv 命令行参数List,第一个元素是程序本身路径 sys.exit(n) 退出程序,正常退出时exit(0),错误退出sys.exit(1) s ...
Python之OS（系统操作）模块常用函数
mkdir(path[, mode=0777]) makedirs(name,mode=511) rmdir(path) removedirs(path) listdir(path) getcwd() ...

随机推荐

JavaScript | ES6 新增
Evernote Export body, td { font-family: 微软雅黑; font-size: 10pt; } ES6 重点知识 this关键字以及bind let/const 变量 ...
MyBatis项目实战快速将MySQL转换成Oracle语句
一.前言因项目需求,小编要将项目从mysql迁移到oracle中 ~ 之前已经完成数据迁移 (https://zhengqing.blog.csdn.net/article/details/103 ...
.Net Core - AgileHttp
2020年新年将至,先预祝.Net Core越来越好. 做了这么多年一线开发,经常跟Http打交道.比如调用三方的Webservice,比如集成微信支付的时候服务端发起Prepay支付.特别是现在分布 ...
使用Java实现简单的Http服务器
在Java中可以使用HttpServer类来实现Http服务器,该类位于com.sun.net包下(rt.jar).实现代码如下: 主程序类 package bg.httpserver; import ...
容器环境的JVM内存设置最佳实践
Docker和K8S的兴起,很多服务已经运行在容器环境,对于java程序,JVM设置是一个重要的环节.这里总结下我们项目里的最佳实践. Java Heap基础知识默认情况下,jvm自动分配的heap ...
测试必备之Java知识（三）—— 集合、Map相关
集合相关 List.Set.Map的区别类型描述 List 允许重复对象,可插入多个null元素,有序 Set 不允许重复对象,只允许一个null元素,无序 Map 不是collection的子接 ...
python3搭建Django项目
1.本次安装的python3.7版本,可前往官网下载,这里的安装不作多余介绍 2.安装虚拟环境第一种:virtualenv:用于创建虚拟环境,实现项目之间的环境隔离,解决项目中存在的版本冲突问题 w ...
AFN请求问题
在使用AFNetworking 2.0 的时候本来一切很顺畅,但是中途遇到几个比较坑的地方在发送请求后,NSURLSessionDataTask一直报错 Error Domain=com.alam ...
spring boot 的中文乱码
首先自检IDEA的编码配置文件加入设置http tomcat spring.http.encoding.force=true spring.http.encoding.charset=UTF-8 ...
C0nw4y's L!f3 G4me 代码实现
这是我转载的博客,关于这个游戏的介绍.估计没人能get到这个游戏的blingbling的地方吧.还是蛮惊叹的. 因为这里网络实在惨淡,闲来无事实现了下这个游戏,UI尽量美化了,可惜python配置不知 ...

re模块 常用函数

re模块 常用函数的更多相关文章

随机推荐

热门专题

re模块常用函数

re模块常用函数的更多相关文章