【发布时间】:2023-03-20 10:24:01
【问题描述】:
我正在使用 Anaconda 4.4.0。尝试使用 0 个或更多字符进行匹配时,我遇到了意外的匹配行为。我的模式似乎只在字符串值的开头起作用,而不是在任何地方匹配。
temp = pd.DataFrame(['#aaaaab_1', 'xxaab_3', 'aaab_5', 'xab_8','ab_13','b_21', '666xyz'] )
temp[0].str.extract('([a-z]*)', expand=True)
0
0 <--missing value
1 xxaab
2 aaab
3 xab
4 ab
5 b
6 <--missing value
temp[0].str.extract('([0-9]*)', expand=True)
0
0 <--missing value
1 <--missing value
2 <--missing value
3 <--missing value
4 <--missing value
5 <--missing value
6 666
在提取一个或多个字符/数字时,匹配行为似乎回到了我的预期。
temp[0].str.extract('([0-9]+)', expand=True)
0
0 1
1 3
2 5
3 8
4 13
5 21
6 666
temp[0].str.extract('([a-z]+)', expand=True)
0
0 aaaaab
1 xxaab
2 aaab
3 xab
4 ab
5 b
6 xyz
【问题讨论】:
标签: python regex pandas dataframe extract