欢迎来到天天文库
浏览记录
ID:5743861
大小:39.20 KB
页数:6页
时间:2017-12-23
《正则表达式学习参考 正则入门学习资料》由会员上传分享,免费在线阅读,更多相关内容在行业资料-天天文库。
1、1概述 正则表达式(RegularExpression)是一种匹配模式,描述的是一串文本的特征。 正如自然语言中“高大”、“坚固”等词语抽象出来描述事物特征一样,正则表达式就是字符的高度抽象,用来描述字符串的特征。 正则表达式(以下简称正则,Regex)通常不独立存在,各种编程语言和工具作为宿主语言提供对正则的支持,并根据自身语言的特点,进行一定的剪裁或扩展。 正则入门很容易,有限的语法规则很容易掌握,但是目前正则的普及率并不高,主要是因为正则的流派众多,各种宿主语言提供的文档都过多的关注于自身的一些细节
2、,而这些细节通常是初学者并不需要关注的。 当然,如果想要深入的了解正则表达式,这些细节又是必须被关注的,这是后话,让我们先从正则的基础开始,进入正则表达式的世界。 2正则表达式基础 2.1基本概念 2.1.1字符串组成对于字符串“a5”,是由两个字符“a”、“5”以及三个位置组成的,这一点对于正则表达式的匹配原理理解很重要。2.1.2 占有字符和零宽度正则表达式匹配过程中,如果子表达式匹配到的是字符内容,而非位置,并被保存到最终的匹配结果中,那么就认为这个子表达式是占有字符的;如果子表达式匹配的仅仅是位置
3、,或者匹配的内容并不保存到最终的匹配结果中,那么就认为这个子表达式是零宽度的。占有字符还是零宽度,是针对匹配的内容是否保存到最终的匹配结果中而言的。占有字符是互斥的,零宽度是非互斥的。也就是一个字符,同一时间只能由一个子表达式匹配,而一个位置,却可以同时由多个零宽度的子表达式匹配。2.1.3 正则表达式构成正则表达式由两种字符构成。一种是在正则表达式中具体特殊意义的“元字符”,另一种是普通的“文本字符”。元字符可以是一个字符,如“^”,也可以是一个字符序列,如“w”。2.2 元字符(MetaCharac
4、ter)2.2.1 […] 字符组(CharacterClasses)字符组可以匹配[]中包含的任意一个字符。虽然可以是任意一个,但只能是一个。字符组支持由连字符“-”来表示一个范围。当“-”前后构成范围时,要求前面字符的码位小于后面字符的码位。[^…] 排除型字符组。排除型字符组表示任意一个未列出的字符,同样只能是一个。排除型字符组同样支持由连字符“-”来表示一个范围。表达式说明[abc]表示“a”或“b”或“c”[0-9]表示0~9中任意一个数字,等价于[0123456789][u4e00-u9f
5、a5]表示任意一个汉字[^a1<]表示除“a”、“1”、“<”外的其它任意一个字符[^a-z]表示除小写字母外的任意一个字符举例:“[0-9][0-9]”在匹配“Windows2003”时,匹配成功,匹配的结果为“20”。“[^inW]”在匹配“Windows2003”时,匹配成功,匹配的结果为“d”。2.2.2 常见字符范围缩写对于一些常用的字符范围,如数字等,由于非常常用,即使使用[0-9]这样的字符组仍显得麻烦,所以定义了一些元字符,来表示常见的字符范围。表达式说明d任意一个数字,相当于[0-9]
6、,即0~9 中的任意一个w任意一个字母或数字或下划线,相当于[a-zA-Z0-9_]s任意空白字符,相当于[rftv]D任意一个非数字字符,d取反,相当于[^0-9]Ww取反,相当于[^a-zA-Z0-9_]S任意非空白字符,s取反,相当于[^rftv]举例:“wsd”在匹配“Windows2003”时,匹配成功,匹配的结果为“s2”。2.2.3 . 小数点小数点可以匹配除“”以外的任意一个字符。如果要匹配包括“”在内的所有字符,一般用[sS],或
7、者是用“.”加(?s)匹配模式来实现。表达式说明.匹配除了换行符 以外的任意一个字符2.2.4 其它元字符表达式说明^匹配字符串开始的位置,不匹配任何字符$匹配字符串结束的位置,不匹配任何字符b匹配单词边界,不匹配任何字符举例:“^a”在匹配“cba”时,匹配失败,因为表达式要求开始位置后面是字符“a”,而“cba”显然是不满足的。“d$”在匹配“123”时,匹配成功,匹配结果为“3”,这个表达式要求匹配结尾处的数字,如果结尾处不是数字,如“123abc”,则是匹配失败的。2.2.5 转义字符一
8、些不可见字符,或是在正则中具有特殊意义的元字符,如想匹配字符本身,需要用“”对其进行转义。表达式说明r,回车和换行\匹配“”本身^,$,.分别匹配“^”、“$”和“.”以下字符在匹配其本身时,通常需要进行转义。在实际应用中,根据具体情况,需要转义的字符可能不止如下所列字符 . $ ^ { [ (
9、 ) * + ? 2.2.6 量词(Quantifier)量词表示一个子表达式可以匹配的次数。量词可以用来修饰
此文档下载收益归作者所有