【问题标题】:Extract text from HTML faster than NLTK?从 HTML 中提取文本比 NLTK 更快?
【发布时间】:2018-04-23 02:43:42
【问题描述】:

我们使用 NLTK 从 HTML 页面中提取文本,但我们只需要最琐碎的文本分析,例如字数。

有没有一种更快的方法可以使用 Python 从 HTML 中提取可见文本?

了解一些最低级别的 HTML(最好是 CSS),比如可见/不可见节点、图像的 alt 文本等,会非常棒。

【问题讨论】:

  • 如何您使用 NLTK 来处理 HTML 页面? nltk 曾经有一个clean_html() 功能,但dropped it 早在2014 年就将工作留给了BeautifulSoup。
  • @alexis:嗯,问得好!在通过源代码挖掘更多之后,我看到nltk 仅用于标记html2text 提取的文本!这完全改变了问题。

标签: python html nltk text-extraction


【解决方案1】:

在我以前的工作场所遇到了同样的问题。你会想看看beautifulsoup。

from bs4 import BeautifulSoup
soup = BeautifulSoup(html)
print soup.text

您可以在此处找到它的文档:https://www.crummy.com/software/BeautifulSoup/bs4/doc/

您可以忽略基于属性的元素。至于理解外部样式表,我不太确定。但是,您可以在那里做的并且不会太慢(取决于页面)的事情是研究使用 phantomjs 之类的东西渲染页面,然后选择渲染的文本:)

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-09-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2010-11-26
    • 2012-04-20
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多