Python基础-----re模块（模糊匹配）

#!/usr/bin/env python
#-*- coding:utf-8 -*-

import re

\'\'\'
1 普通字符：大多数字符和字母都会和自身匹配
              >>> re.findall(\'alex\',\'yuanaleSxalexwupeiqi\')
                      [\'alex\'] 
              re.findall(匹配规则,匹配字符串)
              查找出所有满足匹配规则的字符串放置于列表中
2 元字符：. ^ $ * + ? { } [ ] | ( ) \
\'\'\'

#======================元字符之. ^ $ * + ? { }================================#

# 1  . 表示通配符，除  \n  以外均可匹配，一个  .  表示任意一个字符

ret=re.findall(\'a..in\',\'helloalvin\')
print(ret)#[\'alvin\']

#===========================================================================#

# 2  ^ 表示在字符串的开头匹配

ret=re.findall(\'^a...n\',\'alvinhelloawwwn\')
print(ret)#[\'alvin\']

#===========================================================================#

# 3  $ 表示在字符串的尾部匹配

ret=re.findall(\'a...n$\',\'alvinhelloawwwn\')
print(ret)#[\'awwwn\']

#===========================================================================#

# 4  * 表示在贪婪匹配[0,+oo]

ret=re.findall(\'abc*\',\'abcccc\')#贪婪匹配[0,+oo]  
print(ret)#[\'abcccc\']
ret=re.findall(\'abc*\',\'abeerw\')#贪婪匹配[0,+oo]  
print(ret)#[\'ab\']

#===========================================================================#

# 5  + 表示在贪婪匹配[1,+oo]

ret=re.findall(\'abc+\',\'abccc\')#[1,+oo]
print(ret)#[\'abccc\']

#===========================================================================#

# 6  ？ 表示在贪婪匹配[0,1]可匹配0个或1个

ret=re.findall(\'abc?\',\'abccc\')#[0,1]
print(ret)#[\'abc\']
ret=re.findall(\'abc?\',\'abrtf\')#[0,1]
print(ret)#[\'ab\'] 

#===========================================================================#

# 7  {} 表示匹配重复情况；{0，} == * ；{1，} == +

ret=re.findall(\'abc{1,4}\',\'abccc\')  #表示匹配1-4个c均可
print(ret)#[\'abccc\'] 贪婪匹配

#===========================================================================#

# 8  前面的*,+,?等都是贪婪匹配，也就是尽可能匹配，后面加?号使其变成惰性匹配，其前面的
# 字符被匹配最少次数

ret=re.findall(\'abc*?\',\'abcccccc\')
print(ret)#[\'ab\']

#====================== 元字符之字符集［］================================#

#在字符集［］中 * + ？ 都失去原有意义，当做普通字符去匹配

ret=re.findall(\'a[bc]d\',\'acd\')     #匹配 \'acd\' 或 \'abd\'  
print(ret)#[\'acd\']

ret=re.findall(\'[a-z]\',\'acd\')     #匹配字符串中的\'a\' - \'z\'之间的所有字母
print(ret)#[\'a\', \'c\', \'d\']

ret=re.findall(\'[.*+]\',\'a.cd+\')
print(ret)#[\'.\', \'+\']

#在字符集[]里有功能的符号: - ^ \

ret=re.findall(\'[1-9]\',\'45dha3\')    #匹配字符串中的1-9之间的所有数字
print(ret)#[\'4\', \'5\', \'3\']

ret=re.findall(\'[^ab]\',\'45bdha3\')  #[^]字符集中^表示非；该例表示匹配只要不是a  b即可
print(ret)#[\'4\', \'5\', \'d\', \'h\', \'3\']

cal = re.findall(\'\([^()]*\)\',\'12+(34*6+2-5*(3-1))\')  #可用于计算器
print(cal) #[\'(3-1)\']

ret=re.findall(\'[\d]\',\'45bdha3\')    #\d  匹配任何十进制数；它相当于类 [0-9]。
print(ret)#[\'4\', \'5\', \'3\']

#====================== 元字符之转义符 \ ================================#

# 反斜杠后边跟元字符去除特殊功能,比如\.(用于将 . 转换为普通字符用于匹配)
# 反斜杠后边跟普通字符实现特殊功能,比如\d

# \d   匹配任何十进制数；它相当于类 [0-9]。
# \D   匹配任何非数字字符；它相当于类 [^0-9]。
# \s   匹配任何空白字符；它相当于类 [ \t\n\r\f\v]。
# \S   匹配任何非空白字符；它相当于类 [^ \t\n\r\f\v]。
# \w   匹配任何字母数字字符；它相当于类 [a-zA-Z0-9_]。(_下划线也可匹配出)
# \W   匹配任何非字母数字字符；它相当于类 [^a-zA-Z0-9_]
# \b   匹配一个特殊字符边界，比如空格 ，&，＃等

# 因为在python中\b本身就有特殊含义，所以需要再次转义 \\b或r\'\b\'
ret=re.findall(\'I\b\',\'I am LIST\')
print(ret)#[]
ret=re.findall(r\'I\b\',\'I am LIST\')
print(ret)#[\'I\']
#-----------------------------eg1:
import re
# 因为python解释器转义和re转义有别，所以需要传入多个\来转义
ret=re.findall(\'c\l\',\'abc\le\')
print(ret)#[]
ret=re.findall(\'c\\l\',\'abc\le\')
print(ret)#[]

ret=re.findall(\'c\\\\l\',\'abc\le\')  
print(ret)#[\'c\\l\']
ret=re.findall(r\'c\\l\',\'abc\le\')
print(ret)#[\'c\\l\']

#-----------------------------eg2:
#之所以选择\b是因为\b在ASCII表中是有意义的
m = re.findall(\'\bblow\', \'blow\')
print(m)
m = re.findall(r\'\bblow\', \'blow\')
print(m)

#====================== 元字符之 | ================================#
# 元字符 | 表示或的意思，其前后字符串均可以参与匹配
s = re.findall(\'a|b\',\'ajkkljlbklka\')
print(s)   #[\'a\', \'b\', \'a\']

#====================== 元字符之分组 () ================================#
# 将()内的内容作为一组（整体）来匹配

m = re.findall(r\'(ad)+\', \'adadad\')    ######！！！！！！！！优先匹配()组内的内容
print(m)   #[\'ad\']
#若要匹配字符串中所有的内容，则加上 ?:  即可取消上述优先级
m1 = re.findall(r\'(?:ad)+\', \'adadad\')    ######！！！！！！！！ 【？：】可取消优先级
print(m1)   #[\'ad\',\'ad\',\'ad\']

ret=re.search(\'(?P<id>\d{2})/(?P<name>\w{3})\',\'23/com\')  
#固定格式?P<id>  id表示分组名称--->\'23\'
#固定格式?P<name> name表示分组名称--->\'com\'
#函数会在字符串内查找模式匹配,只到找到第一个匹配然后返回一个包含匹配信息的对象,该对象可以
#通过调用group()方法得到匹配的字符串,如果字符串没有匹配，则返回None。
print(ret.group())#23/com
print(ret.group(\'id\'))#23  #.group(分组名称)  可以获取分组名称对应的值


#===========================================================================#
#=========================      re模块下的常用方法   ===========================#
#===========================================================================#

import re
#1 查找所有
re.findall(\'a\',\'alvin yuan\')    #返回所有满足匹配条件的结果,放在列表里

#2 查找（只到找到第一个匹配）
re.search(\'a\',\'alvin yuan\').group()  #函数会在字符串内查找模式匹配,只到找到第一个匹配然后返回一个包含匹配信息的对象,该对象可以
                                     # 通过调用group()方法得到匹配的字符串,如果字符串没有匹配，则返回None。
#3 查找（仅在字符串开始处进行匹配）
re.match(\'a\',\'abc\').group()     #同search,不过仅在字符串开始处进行匹配

#4 分割
ret=re.split(\'[ab]\',\'abcd\')     #先按\'a\'分割\'a\'的左边无内容，则左边得到\'\'和右边\'bcd\',在对\'\'和\'bcd\'分别按\'b\'分割
print(ret)#[\'\', \'\', \'cd\']

#5 替换
ret=re.sub(\'\d\',\'abc\',\'alvin5yuan6\',1)   
#re.sub(参1,参2,参3,参4) 参1表示匹配规则或字符，参2表示要替换成的字符串，参3表示被匹配的字符串，参4表示指定匹配次数

print(ret)#alvinabcyuan6
ret=re.subn(\'\d\',\'abc\',\'alvin5yuan6\')
print(ret)#(\'alvinabcyuanabc\', 2)  #返回一个元组，分别为替换后字符串，和本次替换的次数

#6 编译（自定义规则）可重复使用
obj=re.compile(\'\d{3}\')            #返回一个规则对象
ret=obj.search(\'abc123eeee\')      #规则对象可以调用.search()  .findall等方法 
print(ret.group())#123

#7 将查找的内容生成迭代器
ret=re.finditer(\'\d\',\'ds3sy4784a\')
print(ret)        #<callable_iterator object at 0x10195f940>
print(next(ret).group()) # \'3\'
print(next(ret).group()) # \'4\'



#===========================================================================#
#=========================    注  意  事  项     ============================#
#===========================================================================#

import re

ret=re.findall(\'www.(baidu|oldboy).com\',\'www.oldboy.com\')
print(ret)#[\'oldboy\']     这是因为findall会优先把匹配结果组里内容返回,如果想要匹配结果,取消权限即可

ret=re.findall(\'www.(?:baidu|oldboy).com\',\'www.oldboy.com\')   #?: 可以去除优先级
print(ret)#[\'www.oldboy.com\']