【发布时间】:2020-04-14 08:43:28
【问题描述】:
我是正则表达式和 Python 的新手。比如我的字符串列表是:
my_try = ['Aas','1Aasdf','cc)','ASD','.ASD','aaaa1','A']
现在,我想删除所有非英文字母的字符串。所以,我只想保留:
['Aas','ASD','A']
我不知道如何使用 ^ 或其他东西来做到这一点?
如果我的数据是:
my_try=pd.DataFrame({'try':
['Aas','1Aasdf','cc)','A2SD','.ASD',
'aaaa1','A','123%']})
然后我使用:
[x for x in my_try if re.match(r'^[a-zA-Z]+$', x['try'])]
为什么会出现这样的错误:
Traceback (most recent call last):
File "C:\feng\myCode\infoExtract\venv\lib\site-packages\IPython \core\interactiveshell.py", line 3319, in run_code
exec(code_obj, self.user_global_ns, self.user_ns)
File "<ipython-input-58-4bd95f31bd0c>", line 1, in <module>
[x for x in my_try if re.match(r'^[a-zA-Z]+$', x['try'])]
File "<ipython-input-58-4bd95f31bd0c>", line 1, in <listcomp>
[x for x in my_try if re.match(r'^[a-zA-Z]+$', x['try'])]
TypeError: string indices must be integers
我该如何解决这个问题?为什么会这样?
【问题讨论】:
-
在您的样本中看不到任何非英文字母。您的意思是使用任何
[^a-zA-Z]删除字符串,或者只保留仅由^[a-zA-Z]+$组成的字符串?
标签: python regex string dataframe letter