【发布时间】:2018-04-23 02:43:42
【问题描述】:
我们使用 NLTK 从 HTML 页面中提取文本,但我们只需要最琐碎的文本分析,例如字数。
有没有一种更快的方法可以使用 Python 从 HTML 中提取可见文本?
了解一些最低级别的 HTML(最好是 CSS),比如可见/不可见节点、图像的 alt 文本等,会非常棒。
【问题讨论】:
-
如何您使用 NLTK 来处理 HTML 页面? nltk 曾经有一个
clean_html()功能,但dropped it 早在2014 年就将工作留给了BeautifulSoup。 -
@alexis:嗯,问得好!在通过源代码挖掘更多之后,我看到
nltk仅用于标记html2text提取的文本!这完全改变了问题。
标签: python html nltk text-extraction