【问题标题】:Node.Js module for extracting web page content?用于提取网页内容的 Node.Js 模块?
【发布时间】:2014-03-21 17:06:24
【问题描述】:

有人可以推荐一个 Node.Js 模块或 Javascript 库(不是基于可读性),可用于从网页和 RSS 提要中提取内容吗?

我找到了一个很好的 PHP 库可以完成这项工作 - http://fivefilters.org/content-only/ - 但正在寻找一个可以做同样工作的 Node.Js 模块。

谢谢!

【问题讨论】:

  • 您可以使用 PhantomJS 来提取内容。

标签: javascript node.js text text-extraction rss-reader


【解决方案1】:

我为此目的编写了一个名为“unfluff”的 Node.js 模块:

https://github.com/ageitgey/node-unfluff

希望这能解决您的问题。

Unfluff 基于流行的“python-goose”和“goose”(Scala) 页面提取库,如果您熟悉这些库的话。

【讨论】:

    【解决方案2】:

    我会推荐cheerio。有几个很好的教程,包括这个:

    http://maxogden.com/scraping-with-node.html

    【讨论】:

    • 谢谢@TankofVines,但是你知道有没有专门设计用于抓取网页内容的cheerio 实现,可以通过简单地调用函数而不编写太多额外代码来使用?我还在这里找到了有 Cheerio 的东西 - codeproject.com/Tips/702699/Web-scraping-with-Node-js - 但似乎你必须对其进行微调,我想要一些现成的解决方案,因为我已经对代码的其他部分进行了大量工作。如果您能给我一些线索,将不胜感激!
    • @deemeetree,抱歉,我不知道 node.js 中有更高级别的解决方案。我快速搜索了 npm 并找到了一些模块,但我认为它们仍然比您要查找的级别低。希望其他人能加入进来。祝你好运。
    • @deemeetree,你在寻找什么样的“简单”API?
    【解决方案3】:

    extract-main-text 也可以很好地从 HTML 中提取内容。 在我的情况下,node-unfluff 对于日语(可能是 CJK)内容并不稳定。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-05-17
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多