【发布时间】:2012-01-27 11:53:30
【问题描述】:
我有一个扫描文本,其中可能有一些乱码。垃圾字符通常既不是字母数字也不是标点符号。
我有以下正则表达式:
garbage_pat = re.compile(r"(\w*(?P<and>[^a-zA-Z0-9_ \t\n\r\f\v,.?!;:])+[\w(?P=and)]*)")
此正则表达式正确查找包含一个垃圾字符的单词。如果有两个或多个垃圾字符,则正则表达式正在拆分单词。 例如 aut~mo¤il 将被分成两个词。当我的正则表达式包含两个或多个垃圾字符时,如何让我的正则表达式返回整个单词。
【问题讨论】: