23 正则表达式和re模块

一.正则
1.字符组  
  [a-zA-Z0-9]字符组中的　  [^a] 除了字符组的

2.

二.re模块

re.S   设置   .的换行       obj=re

1.ret=re.search(正则，content)   找到一个结果就返回  
　　拿到结果  需要.group   ret.group()
2.ret=re.match(正则，content)   从头匹配.  如果匹配到了。 就返回
　　也需要 ret.group()
3.ret=re.findall(正则，content) 匹配到的结果全部放入列表中 ，下级元素以元组存放

import re

ret = re.findall('www.(baidu|oldboy).com', 'www.oldboy.com')

print(ret)  # ['oldboy']     这是因为findall会优先把匹配结果组里内容返回,如果想要匹配结果,取消权限即可

ret = re.findall('www.(?:baidu|oldboy).com', 'www.oldboy.com')

print(ret)  # ['www.oldboy.com']

findall优先级查询

4.ret=re.finditer(正则，content) 得到一个迭代器，循环迭代器时，取值时，也要 用group
for el in ret:
　　el.group()
5.re.split(正则，字符串)  用正则中的每个元素分别进行切割

ret=re.split("\d+","eva3egon4yuan")

print(ret) #结果 ： ['eva', 'egon', 'yuan']

ret=re.split("(\d+)","eva3egon4yuan")

print(ret) #结果 ： ['eva', '3', 'egon', '4', 'yuan']

#在匹配部分加上（）之后所切出的结果是不同的，

#没有（）的没有保留所匹配的项，但是有（）的却能够保留了匹配的项，

#这个在某些需要保留匹配部分的使用过程是非常重要的。

split优先级查询

6.re.sub(正则，new,字符串)  替换  用新的 替换符合正则的元素
7.re.subn(正则，new,字符串)  替换  用新的 替换符合正则的元素替换。    返回的结果带有次数
8. obj=re.compile(正则)    预加载 正则          lst=obj.findall(content)
　　obj=re.compile(r"start.*?(?P<自定义名字>.*j)end",re.S)

import re

res = re.search("e", "alex and exp") # 搜索. 搜到结果就返回

print(res.group())

res = re.match("\w+", "alex is not a good man") #  从头匹配.  如果匹配到了。 就返回

print(res.group())

lst = re.findall("\w+", "alex and exo")

print(lst)

it = re.finditer("\w+", "mai le fo leng")

for el in it:

    print(el.group())

# # 这个分组是优先级

lst = re.findall(r"www\.(baidu|oldboy)\.com", "www.oldboy.com")

print(lst)

# (?: )  去掉优先级

lst = re.findall(r"www\.(?:baidu|oldboy)\.com", "www.oldboy.com")

print(lst)

# 加了括号。 split会保留你切的刀

lst = re.split("([ab])", "alex is not a sb, no he is a big sb") # 根据正则表达式进行切割

print(lst)

#

# # 替换

res = re.sub(r"\d+", "_sb_", "alex333wusir666taibai789ritian020feng")

print(res)

#

# # 替换。 返回的结果带有次数

res = re.subn(r"\d+", "_sb_", "alex333wusir666taibai789ritian020feng")

print(res)

a = eval("1+3+5+6")

print(a)

code = "for i in range(10):print(i)"

c = compile(code, "", "exec") # 编译代码

exec(c)

obj = re.compile(r"alex(?P<name>\d+)and") # 把正则表达式预加载

res = obj.search("alex250andwusir38ritian2")

print(res.group())

print(res.group("name"))

re模块

import re

from urllib.request import urlopen

#正则

obj=re.compile(r'<div class="item">.*? <a href=(?P<URL>.*?)">.*?<span class="title">(?P<name>.*?)</span>'

               r'.*?<span class="rating_num" property="v:average">(?P<fen>.*?)</span>.*?<span>(?P<pingjia>.*?)人评价</span>',re.S)

#获取网页内容函数

def get_content(url):

    content=urlopen(url).read().decode("utf-8")

    return content

#获取网页所要内容转化成字典的函数

def parse(content):

    g=obj.finditer(content)

    for el in g:

        yield {

            '电影名':el.group("name"),

            'url':el.group("URL"),

            '评分':el.group('fen'),

            '评价人数':el.group("pingjia")

        }

#分页爬取

for i in range(10):

    url="https://movie.douban.com/top250?start=%s&filter="%i*25  #每页的url  每页共25部电影

    g=parse(get_content(url))

    f=open("dian.txt","a",encoding="utf-8")

    for el in g:

        f.write(str(el)+"\n")

        # print(el)

    f.close()

爬豆瓣

import re

from urllib.request import urlopen

import json

url="https://www.dytt8.net/"

content=urlopen(url).read().decode("gbk")

obj=re.compile(r"最新电影下载</a>]<a href='(?P<URL>.*?)'>.*?《(?P<name>.*?)》",re.S)

obj2=re.compile(r'<!--Content Start--><span style="FONT-SIZE: 12px"><td>.*?'

                r'【下载地址】</font></font></strong> <br /><br /><br /><a href=".*?(?P<xiazai>.*?)"><strong>',re.S)

lst=obj.findall(content)

f=open("movie",'w',encoding="utf-8")

for el in lst:

    try:

       dic= {"name":el[1],"URL":"https://www.dytt8.net"+el[0]}

       url2=dic["URL"]

       content2=urlopen(url2).read().decode("gbk")

       dz=obj2.search(content2).group("xiazai")

       dic2={"name":dic["name"],"地址":dz}

       s=json.dumps(dic2,ensure_ascii=False)

       f.write(s+"\n")

       print(dic)

    except Exception as e:

        continue

f.close()

爬电影天堂

23 正则表达式和re模块的更多相关文章

【Python爬虫】正则表达式与re模块
正则表达式与re模块阅读目录在线正则表达式测试常见匹配模式 re.match re.search re.findall re.compile 实战练习在线正则表达式测试 http://tool ...
python 正则表达式re使用模块（match()、search()和compile()）
摘录 python核心编程 python的re模块允许多线程共享一个已编译的正则表达式对象,也支持命名子组.下表是常见的正则表达式属性: 函数/方法描述仅仅是re模块函数 compile(patt ...
python正则表达式之re模块方法介绍
python正则表达式之re模块其他方法 1:search(pattern,string,flags=0) 在一个字符串中查找匹配 2:findall(pattern,string,flags=0) ...
Python之正则表达式（re模块）
本节内容 re模块介绍使用re模块的步骤 re模块简单应用示例关于匹配对象的说明说说正则表达式字符串前的r前缀 re模块综合应用实例正则表达式(Regluar Expressions)又称规则 ...
【转】Python之正则表达式（re模块）
[转]Python之正则表达式(re模块) 本节内容 re模块介绍使用re模块的步骤 re模块简单应用示例关于匹配对象的说明说说正则表达式字符串前的r前缀 re模块综合应用实例参考文档提示: ...
Python与正则表达式[0] -> re 模块的正则表达式匹配
正则表达式 / Regular Expression 目录正则表达式模式 re 模块简介使用正则表达式进行匹配正则表达式RE(Regular Expression, Regexp, Regex) ...
正则表达式之re模块
re模块一.什么是正则表达式与re模块?1.1 字符组1.2 元字符1.2.1 单个使用1.2.2 组合使用二.为什么要使用正则三.如何使用3.1 re模块的三种比较重要的方法3.1.1 findal ...
python学习笔记（十）——正则表达式和re模块
#正则表达式和re模块 # match(pattern, string,[flag]) #在字符串开始时进行匹配 # pattern 正则表达式 # string 要匹配的字符串 # [flag] 可 ...
正则表达式和re模块
目录 re的元字符字符集[ ] 转义符分组 ( ) |符号 re下的常用方法分组 re的元字符 import re ret = re.findall("e..a", &quo ...

随机推荐

Python: 从字典中提取子集--字典推导
问题: 构造一个字典,它是另外一个字典的子集 answer: 最简单的方式是使用字典推导 eg1: 1. >>>prices = {'ACME': 45.23, 'AAPL': 61 ...
cisco路由器三层交换机简单环境配置实例(图)
出处:http://www.jb51.NET/softjc/56600.html cisco路由器&三层交换机简单环境配置实例一.网络拓扑图: 二.配置命令: 1.路由器的配置: inter ...
Java系列笔记(5) - 线程
我想关注这个系列博客的粉丝们都应该已经发现了,我一定是个懒虫,在这里向大家道歉了.这个系列的博客是在我工作之余写的,经常几天才写一小节,不过本着宁缺毋滥的精神,所有写的东西都是比较精炼的.这篇文章是本 ...
Redis计算地理位置距离-GeoHash
Redis 在 3.2 版本以后增加了地理位置 GEO 模块,意味着我们可以使用 Redis 来实现摩拜单车「附近的 Mobike」.美团和饿了么「附近的餐馆」这样的功能了. 地图元素的位置数据使用二 ...
linux查看内存free
free 加参数-b/k//m/g,以b.k.m.g的大小显示结果,默认以k显示 [root@oldboy ~]# free total used free shared buffers cached ...
20145324王嘉澜《网络对抗技术》 MAL_逆向与Bof基础
实践目标 •本次实践的对象是一个名为pwn1的linux可执行文件. •该程序正常执行流程是:main调用foo函数,foo函数会简单回显任何用户输入的字符串. •该程序同时包含另一个代码片段,get ...
解决Navicat Premium 12 连接oracle数据库出现ORA-28547的问题
1. 出现的问题... 下午工作时想连接Oracle数据库,使用的是Navicat Premium 12 . 数据库地址.用户名.密码.端口号都没有问题,但出现了ORA-28547:connectio ...
VC++ 获取文件属性创建时间、修改时间和访问时间
转载:http://blog.sina.com.cn/s/blog_66bf8d8301014ikd.html WIN32_FIND_DATA结构关于文件的全部属性信息,总计有以下以下9 种:文件的 ...
Python3基础 __setattr__ 在属性被赋值的时候，新增提示功能
Python : 3.7.0 OS : Ubuntu 18.04.1 LTS IDE : PyCharm 2018.2.4 Conda ...
ZooKeeper 增加Observer部署模式提高性能
Observer:在不伤害写性能的情况下扩展ZooKeeper. 虽然通过Client直接连接到ZooKeeper集群的性能已经很好了,可是这样的架构假设要承受超大规模的Client,就必须添加Zoo ...

23 正则表达式和re模块

23 正则表达式和re模块的更多相关文章

随机推荐

热门专题