【问题标题】:Python- is there a module that will automatically scrape the content of an article off a webpage?Python-是否有一个模块可以自动从网页上抓取文章的内容?
【发布时间】:2011-07-01 04:31:32
【问题描述】:

我知道有 lxml 和 BeautifulSoup,但这不适用于我的项目,因为我事先不知道我试图从其中抓取文章的网站的 HTML 格式是什么。有没有类似于 Readability 的 Python 类型的模块,在查找文章内容并返回它方面做得很好?

【问题讨论】:

  • 今天早些时候有人问过这个问题,是你吗?
  • Instapaper-like algorithm的可能重复
  • 不是真正的重复。我认为 OP 想要一个类似于 python 中的 readability.js 模块,这是公平的要求。只是措辞不明确。

标签: python algorithm screen-scraping beautifulsoup lxml


【解决方案1】:

可以使用 PhantomJS (C++) 或 PyPhantomJS (Python)。

它们都是基于 WebKit 的无头浏览器,您可以通过 JavaScript 完全控制它们。因为你可以通过 JavaScript 来控制它,所以我发现它真的很容易做一些事情,比如抓取文章的内容。

PyPhantomJS 也有一个插件系统,所以这绝对是一个加分项。 :)

【讨论】:

【解决方案2】:

无法自动从内容页面中提取真实内容 - 至少不能使用标准工具。您必须定义/识别真实内容的存储位置(通过在您自己的 HTML 提取代码中指定相关的 CSS ID 或类)。

【讨论】:

  • 当然可以自动完成。它可能更难,需要相当多的机器学习或其他花哨的算法,而且可能不会 100% 有效,但我敢打赌,它可以做到。
【解决方案3】:

使用 HTQL,查询是: &html_main_text

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-05-24
    • 1970-01-01
    • 1970-01-01
    • 2017-04-05
    • 1970-01-01
    • 2013-07-10
    • 2023-01-29
    • 1970-01-01
    相关资源
    最近更新 更多