【发布时间】:2017-06-28 13:50:31
【问题描述】:
我正在尝试从newspaper 下载使用Article 的文章,并尝试使用nltk word_tokenizer 对单词进行标记。问题是,当我尝试打印已解析的文章文本时,其中一些文章具有特殊的引号,例如 “、”、’,它们不会被标记器过滤掉,因为它会是常规的' 和 "。
有没有办法用普通引号替换这些特殊引号,或者更好地删除标记器可能遗漏的所有可能的特殊字符?
我试图通过在代码中明确提及这些特殊字符来删除它们,但它给了我错误Non-UTF-8 code starting with '\x92'。
【问题讨论】:
标签: python nltk python-newspaper