【发布时间】:2017-01-09 09:14:00
【问题描述】:
我已经阅读了很多类似的问题,但没有找到解决我在数据清理过程中遇到的所有问题的解决方案。
我有一个脚本可以抓取一组网站并从页面正文中获取特定的文本块。
我遇到的问题是文本中仍然存在 html 标记、引号的不同符号(例如,不是 ' 而是 ` 或更糟的情况)、& 之类的东西等等。
现在我通过自己的清理函数解析文本,但它们并不完美,仍然会遗漏一些情况。
我想知道是否有一个包或通用方法可以从所有这些情况中清除一个字符串,并将诸如 ` 转换为 ' 之类的字符等等?
【问题讨论】:
-
举个例子
标签: python unicode web-scraping