【发布时间】:2012-05-21 00:13:54
【问题描述】:
有像DOM这样的标准方法可以选择性地解析一个html页面,但我想知道爬虫(从小到大)如何检测到要分析的主要文本在哪里?
将被分析以捕获其关键字的主要文本与菜单、侧边栏、页脚等混合在一起。爬虫如何知道从菜单和侧面部分中跳过关键字?
我正在开发一个小型 PHP 项目,以从各种 HTML 页面中捕获关键字,但我不知道如何避免从侧面内容中捕获关键字。谁能描述或至少给我一个提示如何区分 HTML 页面中的主要内容和其他内容?
【问题讨论】:
-
我不是在谈论搜索结果。例如,在解析当前页面时,如何识别正文是我的问题及其答案;不是侧边栏、相关问题列表、菜单、StackOverflow 注释等。我说的是编写爬虫,而不是如何控制爬虫处理我的网站的方式。
-
看看Readability project,已经移植到PHP和Python了
标签: php dom html-parsing web-crawler