【问题标题】:Extract content out web articles and display them in a nice way从网络文章中提取内容并以一种很好的方式显示它们
【发布时间】:2012-09-02 09:48:24
【问题描述】:

我正在尝试制作一些东西,允许人们从例如边缘的文章中输入网址。它所做的是读取 url/article 并以一种很好的方式显示它,比如可读性。但我真的被困住了,我无法在任何地方找到有关如何做到这一点的信息。有没有关于如何做到这一点的api。它实际上不是只扫描一篇文章,而是扫描整个 rss 提要。

【问题讨论】:

    标签: php url rss xml-parsing web-crawler


    【解决方案1】:

    您正在寻找boilerpipe。它应该完全符合您的要求。甚至还有一个 Web API。您还可以下载该模块并从 Python 脚本中使用它。

    您可以在此处对您选择的文章进行测试:http://boilerpipe-web.appspot.com。只需选择 ArticleExtractor 作为提取器。

    【讨论】:

      【解决方案2】:

      应该是最简单的方法:http://simplehtmldom.sourceforge.net/

      您可以简单地使用 css/jquery 等定位元素

      【讨论】:

        【解决方案3】:

        您可以使用正则表达式快速完成此操作,也可以导入 DOM。请注意,无论您使用正则表达式还是正确解析 DOM,适用于一个网站的解决方案不太可能适用于另一个网站。

        【讨论】:

        • 欢迎来到 Stack Overflow。为敢于提及parsing HTML with regex准备无尽的燃烧。
        • 我并不是说可以用正则表达式解析 HTML,因为我知道这是错误的。我只是说可以使用正则表达式提取始终被相同 HTML 包围的文本的 sn-ps。
        • 我的评论是完全半开玩笑:)
        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2016-07-08
        • 2015-06-25
        • 2015-07-04
        • 2014-12-24
        • 2023-03-11
        • 1970-01-01
        • 2022-01-18
        相关资源
        最近更新 更多