【发布时间】:2010-10-15 11:45:37
【问题描述】:
我一直在考虑这个问题,所以我想我会寻求建议:
我有一些爬虫进入某个站点的根目录(可以是来自 www.StackOverFlow.com、www.SomeDudesPersonalSite.se 甚至 www.Facebook.com 的任何内容)。然后我需要确定我正在访问的“主页类型”。不同的类型可能是:
- 论坛
- 博客
- 链接目录
- 社交媒体网站
- 新闻网站
- “单人站点”
我已经集思广益了一段时间,最好的解决方案似乎是一些带有积分系统的启发式方法。我的意思是不同的趋势对不同的类型给出一些分数,然后程序会进行猜测。
但这就是我卡住的地方。你如何检测趋势?
- 目录可能很容易:如果站点索引/传出链接非常高,目录应该得到几个点。
- 新闻网站/博客可能很简单:如果索引的大量网站都有日期时间,那么这些类型应该会得到几分。
但我真的找不到太多趋势。
所以:我的问题是: 关于如何做到这一点的任何想法?
非常感谢..
【问题讨论】:
-
此类问题的解决方案可能是企业的基础。像这样完善一个算法可能不是一件容易的事
-
阅读一本关于机器学习/数据挖掘的好书。
-
使用人类——Amazon Mechanical Turk 让大量此类物品变得非常便宜。
标签: algorithm web-crawler heuristics