【问题标题】:Pandas not matching zero or more digits/characters when extracting a string from a dataframe从数据框中提取字符串时,熊猫不匹配零个或多个数字/字符
【发布时间】:2023-03-20 10:24:01
【问题描述】:

我正在使用 Anaconda 4.4.0。尝试使用 0 个或更多字符进行匹配时,我遇到了意外的匹配行为。我的模式似乎只在字符串值的开头起作用,而不是在任何地方匹配。

temp = pd.DataFrame(['#aaaaab_1', 'xxaab_3', 'aaab_5', 'xab_8','ab_13','b_21', '666xyz'] )
temp[0].str.extract('([a-z]*)', expand=True)

       0
0            <--missing value
1  xxaab
2   aaab
3    xab
4     ab
5      b
6            <--missing value

temp[0].str.extract('([0-9]*)', expand=True)

     0
0           <--missing value    
1           <--missing value    
2           <--missing value         
3           <--missing value         
4           <--missing value         
5           <--missing value         
6  666

在提取一个或多个字符/数字时,匹配行为似乎回到了我的预期。

temp[0].str.extract('([0-9]+)', expand=True)

     0
0    1
1    3
2    5
3    8
4   13
5   21
6  666

 temp[0].str.extract('([a-z]+)', expand=True)

        0
0  aaaaab
1   xxaab
2    aaab
3     xab
4      ab
5       b
6     xyz

【问题讨论】:

    标签: python regex pandas dataframe extract


    【解决方案1】:

    您面临的问题是str.extract 找到第一个搜索(空字符串也满足这一要求,这也是您输出的原因),然后返回该匹配项而无需进一步查找。恰好第 2nd 到 6th 行返回的不仅仅是一个空字符串,因为空字符串后面跟着更多匹配的字符。

    正如您已经发现的那样,解决方案是以空字符串永远无法匹配的方式修改您的正则表达式(即避免使用*)。

    【讨论】:

      【解决方案2】:

      你没有得到任何缺失值,你得到的是空字符串。 (它们不一样。)'([0-9]*)' 匹配任何空数字字符串,并且数据帧的前六行肯定以空数字字符串开头。您应该要么要求至少一个数字的字符串'([0-9]+)',要么通过首先要求任何非数字字符串,然后是任何数字字符串来“欺骗”正则表达式:

      temp[0].str.extract('[^0-9]*([0-9]*)', expand=True)
      #     0
      #0    1
      #1    3
      #2    5
      #3    8
      #4   13
      #5   21
      #6  666
      

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2020-06-03
        • 2020-11-17
        • 1970-01-01
        • 1970-01-01
        • 2021-01-31
        • 2019-03-06
        • 2017-10-12
        相关资源
        最近更新 更多