【问题标题】:PHP RSS Feed CrawlerPHP RSS 提要爬虫
【发布时间】:2014-05-24 04:11:12
【问题描述】:

我想为我的网站构建一个 RSS Feed Crawler。虽然我不太确定,如何开始。我的爬虫如何识别 RSS 提要?有什么我可以抓取的东西,每个 RSS 阅读器都有吗? 我不需要任何代码,只需要帮助我的大脑理解我必须创建的内容。

谢谢!

问候

夏捷涅夫

【问题讨论】:

  • 如果您不想重新发明轮子,请查看superfeedr.com :)
  • 嘿,看起来很酷,但是我能用它做什么呢? :P 这似乎是一个巨大的提要数据库,我(可能)在其中获得了很多 RSS 提要。对吗?^^

标签: javascript php ajax xml rss


【解决方案1】:

我认为,如果您的爬虫扫描所有链接并至少打开每个页面一次以查找文本 <rss version="2.0">,这是可能的。据我了解,每个 RSS 提要都应该包含这一行。

<?xml version="1.0" encoding="UTF-8" ?>
<rss version="2.0">
<channel>
 <title>RSS Title</title>
 <description>This is an example of an RSS feed</description>
 <link>http://www.someexamplerssdomain.com/main.html</link>
 <lastBuildDate>Mon, 06 Sep 2010 00:01:00 +0000 </lastBuildDate>
 <pubDate>Mon, 06 Sep 2009 16:20:00 +0000 </pubDate>
 <ttl>1800</ttl>

 <item>
  <title>Example entry</title>
  <description>Here is some text containing an interesting description.</description>
  <link>http://www.wikipedia.org/</link>
  <guid>unique string per item</guid>
  <pubDate>Mon, 06 Sep 2009 16:20:00 +0000 </pubDate>
 </item>

</channel>
</rss>

如果您打算使用 PHP,我对使用 PHP 构建的 SimpleXML 有非常积极的体验。

附:不客气 Xatenev ;)

【讨论】:

  • 我如何才能真正抓取这些 RSS 提要?我的爬虫如何识别这些,并将我需要的数据返回给我?
  • 不知道大家对正则表达式有没有经验,我觉得应该是这样。
  • 我知道正则表达式,但我的意思是一个爬虫,例如,只是去一个网站并获取所有链接,然后他继续在另一个网站上爬行。如何获取网站上的所有 RSS 提要?这些链接很容易从源代码中找到,我也可以从源代码中找到 RSS 提要吗?
  • 你能再澄清一下吗?我认为如果您的爬虫扫描所有链接并至少打开每个页面一次以查找文本“”,这是可能的。据我了解,每个 RSS 提要都应该包含这一行。
  • 啊这就是我想知道的,非常酷,谢谢!感谢您的良好解释:)。
猜你喜欢
  • 2023-03-22
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-09-24
  • 2014-05-28
  • 2019-11-07
  • 2011-08-03
  • 1970-01-01
相关资源
最近更新 更多