【发布时间】:2013-02-19 19:55:38
【问题描述】:
考虑一下在 Python 3 中使用正则表达式的 sn-p:
>>> t = "Meu cão é #paraplégico$."
>>> re.sub("[^A-Za-z0-9 ]","",t,flags=re.UNICODE)
'Meu co paraplgico'
为什么会删除非ASCII字符?我试过不带flag,都是一样的。
作为奖励,任何人都可以在 Python 2.7 上进行这项工作吗?
【问题讨论】:
-
我正在使用 python 3.2
-
因为
a-z是abcdef...xyz,而这不包括ã。如果您想要所有单词字符,请使用\w。
标签: python regex unicode python-3.x