【发布时间】:2009-08-05 13:47:03
【问题描述】:
我正在编写一个特殊的类似爬虫的应用程序,它需要检索各个页面的主要内容。只是为了澄清:我需要页面的真正“肉”(如果有的话,自然)
我尝试了各种方法:
- 许多页面都有 rss 提要,因此我可以阅读提要并获取此页面的特定内容。
- 许多页面使用“内容”元标记
- 在很多情况下,呈现在屏幕中间的对象是页面的主要“内容”
然而,这些方法并不总是有效,我注意到 Facebook 在这方面做得非常好(当你想附加一个链接时,他们会向你展示他们在链接页面上找到的内容) .
那么 - 你对我看过的方法有什么建议吗?
谢谢!
【问题讨论】:
-
你为什么认为有有任何“主要内容”?
标签: webpage web-crawler