【发布时间】:2012-09-02 09:48:24
【问题描述】:
我正在尝试制作一些东西,允许人们从例如边缘的文章中输入网址。它所做的是读取 url/article 并以一种很好的方式显示它,比如可读性。但我真的被困住了,我无法在任何地方找到有关如何做到这一点的信息。有没有关于如何做到这一点的api。它实际上不是只扫描一篇文章,而是扫描整个 rss 提要。
【问题讨论】:
标签: php url rss xml-parsing web-crawler
我正在尝试制作一些东西,允许人们从例如边缘的文章中输入网址。它所做的是读取 url/article 并以一种很好的方式显示它,比如可读性。但我真的被困住了,我无法在任何地方找到有关如何做到这一点的信息。有没有关于如何做到这一点的api。它实际上不是只扫描一篇文章,而是扫描整个 rss 提要。
【问题讨论】:
标签: php url rss xml-parsing web-crawler
您正在寻找boilerpipe。它应该完全符合您的要求。甚至还有一个 Web API。您还可以下载该模块并从 Python 脚本中使用它。
您可以在此处对您选择的文章进行测试:http://boilerpipe-web.appspot.com。只需选择 ArticleExtractor 作为提取器。
【讨论】:
应该是最简单的方法:http://simplehtmldom.sourceforge.net/
您可以简单地使用 css/jquery 等定位元素
【讨论】:
您可以使用正则表达式快速完成此操作,也可以导入 DOM。请注意,无论您使用正则表达式还是正确解析 DOM,适用于一个网站的解决方案不太可能适用于另一个网站。
【讨论】: