Linux平台上被广泛使用的正则表达式库PCRE - Perl-compatible regular expressions,从其名字即可知道,PCRE提供的是一套与Perl中相兼容的正则表达式。

元字符(Meta-character)

  • '\' :
    在任何元字符前面加上反斜线,就会使它失去元字符的特殊作用。例如/3\.1415/这个模式里没有通配符
  • '^' : 匹配行首;在字符集中它是脱字符,表示求补集
  • '$' : 匹配行尾(或结尾处新行之前字符)
  • '.' :
    除新行(newline)外的任一字符('/s'选项将使'.'匹配新行字符)
  • '|' : 或,表示左边匹配或右边匹配都可以
  • '('与')' :
    分组,例如 “/(fred)+/” 可匹配“fredfredfred”这样的字符串
  • '['与']' :
    字符类。表示一类字符集合中任意一个,方括号内可使用'-'表示范围,如[0-9]表示匹配数字0到9; 也可使用'^‘表示求补集,如[^0-9]表示除数字0到9外的其他字符

下面量词中的前三个字符也是元字符
量词(Quantifier)

  • '*' : 0或任意次。例如“\t*”表示0到任意多个字表符;“.*”捡破烂模式,它能通吃所有的字符串
  • '+' : 1或更多次
  • '?' : 0或1次
  • {n} : n次
  • {n,} : 至少n次
  • {n, m} : n到m次。例如“/a{5,15}/”可以匹配重复5到15次的字母a

自动匹配变量

  • $`: 匹配部分的前一部分存放在$`之中,后面的符号在键盘左上方与“ ~ ”在一个键上
  • $&:整个被匹配上的部分保存在这个变量中
  • $':这个变量保存了字符串中剩下的部分,即除了匹配部分的前一部分,被匹配上的部分后剩下的部分。

匹配方式

  • 贪婪(greedy)方式:在模式其余部分匹配前提下,尽可能多地匹配字符。

贪婪量词:+和*

  • 非贪婪匹配(minimum): 对于每一个贪婪的量词,都有一个非贪婪的量词。以加号(+)为例,
    我们可以改用非贪婪的量词+?,这表示一次或更多匹配(加号的本意)。但是匹配的字符串却  
    是越短越好,而不再是越长越好。

非贪婪量词:+?和*?

  • 占有式:与贪婪方式相近,尽可能多地匹配字符,但绝不回退(backtrack,即使模式其余部分无法匹配,也不减少本部分的匹配数量)。在数量词之后使用'+'表示使用占有式匹配。

转义序列

  • '\t' : 制表符(HT, TAB)
  • '\n' : 换行(LF, NL)
  • '\r' : 回车(CR)
  • '\f' : 进纸(Form Feed, FF)
  • '\a' : 报警 (Alarm, BEL)
  • '\e' : 转义(ESC)
  • "\0xx" : 八进制数值对应字符,如\033表示ESC
  • "\xhh" : 16进制数值对应字符,如\x1B表示ESC
  • "\x{hhhh}" : 16进制long型数值对应字符,如\x{263a}表示unicode SMILEY
  • "\cK" : K可以为任意字母,表示控制字符"control-K","\cK"表示如VT
  • "\N{name}" : unicode命名字符
  • "\N{U+hhhh}" : unicode字符
  • '\l' : 小写下一字符
  • '\u' : 大写下一字符
  • '\L' : 小写随后字符串直至'\E'
  • '\U' : 大写随后字符串直至'\E'
  • '\E' : 结束大小写转换
  • '\Q' : 引用随后字符(禁止转义)直至'\E'

字符类及其他转义字符

  • '\w' :
    匹任任一单词(word)字符(26个英文字母、10个数字,加下划线'_'),等同于字符集[A-Za-z0-9_]
  • '\W' : 匹配任一非单词字母
  • '\s' : 任一空白字符(空格' ', 制表符'\t'等)
  • '\S' : 任一非空白字符
  • '\d' : 任一数字字符[0-9]
  • '\D' : 任一非数字字符
  • “\pP” : 匹配命名属性P
  • "\PP" : 匹配非P
  • '\X' : 匹配unicode扩展字符集(eXtended grapheme cluster)
  • '\C' : 匹配单个C字符(字节),即使工作在unicode模式下
  • '\n' : n为数字,后向引用指定组n
  • "\gn" : 后向引用指定组n
  • "\g{-n}" : 表示相对(当前位置之前的)第n个后用引用组n
  • "\g{name}" :
    后向引用命名组(name)。例如“(/(.)\g{1}ll)”可以匹配aall这样的字符串,aa为连续相同的两个字符
  • "\k{name}" : 后向引用
  • '\K' : 使\K左侧部分,不引入到$&中
  • '\N' : 除'\n'外的任一字符
  • '\v' : 垂直空白符
  • '\V' : 非垂直空白符
  • '\h' : 水平空白符
  • '\H' : 非水平空白符
  • '\R' : 行分割符号

POSIX字符类

POSIX字符类表示语法:[:class:],
在pattern中则必须写为"[[:class:]]"。

  • "[[:alpha:]]" : (英文)字母
  • "[[:alnum:]]" : 字母或数字字符
  • "[[:ascii:]]" : ASCII字符集中字符
  • "[[:blank:]]" : GNU扩展,等价于空格' '或水平制表符'\t'
  • "[[:cntrl:]]" : 任一控制字符
  • "[[:digit:]]" : 任一数字字符,等价于'\d'
  • "[[:graph:]]" : 除空格外的任一可打印字符
  • "[[:lower:]]" : 任一小写字符
  • "[[:print:]]" : 任一可打印字符,包括空格
  • "[[:punct:]]" : 除单词字符(字母,'_')外的任一图形字符
  • "[[:space:]]" : 任一空白字符,等价于'\s'垂直制表符"\cK"
  • "[[:upper:]]" : 任一大写字符
  • "[[:word:]]" : Perl扩展, 等价于'\w'
  • "[[:xdigit:]]" : 任一16进制数字

Perl中,"[[^:class:]]"表示posix指定类的补集,这种情况下也可略去[::],在类名前加'^'表示为"[^class]"。

  • '\b' : 单词边界。例如整单词搜索模式“/\bFred\b/”,可以匹配Fred或fred
  • '\B' : 非单词边界
  • '\A' : 字符串首
  • '\Z' : 字符串尾或尾部换行字符之前
  • '\z' : 字符串尾
  • '\G' : 在上一个匹配处进行匹配

<摘录>perl正则表达式中的元字符、转义字符、量词及匹配方式的更多相关文章

  1. 【Perl】perl正则表达式中的元字符、转义字符、量词及匹配方式

    Linux平台上被广泛使用的正则表达式库PCRE - Perl-compatible regular expressions,从其名字即可知道,PCRE提供的是一套与Perl中相兼容的正则表达式. 元 ...

  2. 正则表达式中pw、IDCard和EM匹配

    1密码强度正则 //密码强度正则,最少6位,包括至少1个大写字母,1个小写字母,1个数字,1个特殊字符 var pPattern = /^.*(?=.{6,})(?=.*\d)(?=.*[A-Z])( ...

  3. 备忘:js正则表达式中的元字符

    Predefined term Matches \t Horizontal tab \b Backspace \v Vertical tab \f Form feed \r Carriage retu ...

  4. Perl正则表达式例子

    Perl正则表达式 一.介绍 正则表达式各语言都有自己的规范,但是基本都差不多,都是由元字符的组合来进行匹配:由于Nmap内嵌的服务与版本探测是使用的Perl正则规范,因此此篇博客记录一下Perl正则 ...

  5. JS 正则表达式中的特殊字符

    正则表达式中的特殊字符 字符 含意 \ 做为转意,即通常在"\"后面的字符不按原来意义解释,如/b/匹配字符"b",当b前面加了反斜杆后/\b/,转意为匹配一个 ...

  6. python正则表达式中的分组 group

    维基百科:http://wiki.ubuntu.org.cn/Python%E6%AD%A3%E5%88%99%E8%A1%A8%E8%BE%BE%E5%BC%8F%E6%93%8D%E4%BD%9C ...

  7. * 和 ?在 shell 命令行中与在正则表达式中的区别

    Linux 正则表达式 你有没有想过,在 shell 命令行中的 *,?和正则表达式中的*,?是否一样? 自打好多年前接触 DOS,就知道了* 和?这两个通配符(Wildcard),象 dir *.* ...

  8. Delphi 正则表达式语法(4): 常用转义字符与 .

    Delphi 正则表达式语法(4): 常用转义字符与 . // \d 匹配所有数字, 相当于 [0-9] var   reg: TPerlRegEx; begin   reg := TPerlRegE ...

  9. 正则表达式中 group groups区别

    先看代码instance: 1 >>> a="123abc456" 2 >>> import re 3 >>> print(r ...

随机推荐

  1. linux驱动基础系列--Linux 串口、usb转串口驱动分析

    前言 主要是想对Linux 串口.usb转串口驱动框架有一个整体的把控,因此会忽略某些细节,同时里面涉及到的一些驱动基础,比如字符设备驱动.平台驱动等也不进行详细说明原理.如果有任何错误地方,请指出, ...

  2. DIV+CSS综合实例【传智PHP首页】

    1.首页结构 2.准备工作 所有素材放到与当前网页同级的目录下: 网页背景色.背景图: 主页宽度:1000px: 创建CSS文件,将CSS文件引入到当前的HTML文件中. 3.实现 效果图: HTML ...

  3. 工具===代替cmd的conemu设置

    conemu设置 Win+Alt+P进入设置界面,字体设置: 隐藏右上角菜单和窗口标题. (Ctrl + ~ 隐藏/显示terminal) 设置背景图片 避免误操作,关闭/新建确认 设置win+w默认 ...

  4. 网络知识===wireshark抓包,三次握手分析

    TCP需要三次握手建立连接: 网上的三次握手讲解的太复杂抽象,尝试着使用wireshark抓包分析,得到如下数据: 整个过程分析如下: step1 client给server发送:[SYN] Seq ...

  5. git - 开发者电脑与服务器的配置

    首先公司要有一台git服务器,现在一般都托管在github服务器上,在中国可能会托管到oschina上,oschina有一点好处就是可以免费托管私有项目,而在github上想要托管自己的项目是收费的, ...

  6. 【LabVIEW技巧】你可以不懂OOP,却不能不懂封装

    前言 大多数写LabVIEW程序的工程师都不是一个纯软的工程师,很多做硬件的.做机械的.甚至学化学的也会学习LabVIEW. 由于主要重心不在软件,所以LabVIEW程序基本上能用行,也就得到入门容易 ...

  7. IntelJ IDEA 进行Java Web开发+热部署+一些开发上的问题

    基本上像放弃MyEclipse或者Eclipse了,因为IDEA现在也有对应的版本旗舰版和社区版了,而且使用更贴心,更给力,为什么还要选一个难用的要死的东西呢? 最近要开发一个Java Web项目,所 ...

  8. hadoop3.1 ha高可用部署

    1.资源角色规划

  9. Pycharm5注册方式 @LYRE}}(T1[DD[@81IZDU$A

    0x1 ,安装 0x2 , 调整时间到2038年. 0x3 ,申请30天试用 0x4, 退出pycharm 0x5, 时间调整回来. 注册方法2:    在 注册时选择 License server ...

  10. 【笔试题】Java 易错题精选

    笔试题 Java 易错题精选 1.写出下列程序的运行结果( )String 不变性Java 值传递 public class Test { public static void main(String ...