【发布时间】:2017-06-12 13:17:54
【问题描述】:
我的脚本正在读取一个文本文件并从中获取最常用的单词。但是,在此过程中的某一时刻,在清理源文本期间,它无法处理重音字符(在这种情况下,它们是 áéíóöőúüű)。
这是我目前拥有的。
str = re.sub(r'\W+', ' ', str)
这只是删除重音字符。我尝试添加flags=re.U,但它只是以不同的方式弄乱了结果。我怀疑有一种简单的方法可以解决我的问题,我一直在寻找它,但没有成功,所以我求助于你。提前致谢。
【问题讨论】:
-
你用的是什么python版本?
-
@DSLima90 2.7.10
-
不是清洁解决方案,但我的任务是类似的工作。您可以使用 unidecode.unidecode(text) 将这些字符转换为它们的逻辑标准 ascii。 pypi.python.org/pypi/Unidecode这可能比剥离它们更好。
-
@samuset:请注意:
str不是 Python 中变量的好名称。使用s。