【问题标题】:Algorithm: Determining type of homepage?算法:确定主页的类型?
【发布时间】:2010-10-15 11:45:37
【问题描述】:

我一直在考虑这个问题,所以我想我会寻求建议:

我有一些爬虫进入某个站点的根目录(可以是来自 www.StackOverFlow.com、www.SomeDudesPersonalSite.se 甚至 www.Facebook.com 的任何内容)。然后我需要确定我正在访问的“主页类型”。不同的类型可能是:

  • 论坛
  • 博客
  • 链接目录
  • 社交媒体网站
  • 新闻网站
  • “单人站点”

我已经集思广益了一段时间,最好的解决方案似乎是一些带有积分系统的启发式方法。我的意思是不同的趋势对不同的类型给出一些分数,然后程序会进行猜测。

但这就是我卡住的地方。你如何检测趋势?

  • 目录可能很容易:如果站点索引/传出链接非常高,目录应该得到几个点。
  • 新闻网站/博客可能很简单:如果索引的大量网站都有日期时间,那么这些类型应该会得到几分。

但我真的找不到太多趋势。

所以:我的问题是: 关于如何做到这一点的任何想法?

非常感谢..

【问题讨论】:

  • 此类问题的解决方案可能是企业的基础。像这样完善一个算法可能不是一件容易的事
  • 阅读一本关于机器学习/数据挖掘的好书。
  • 使用人类——Amazon Mechanical Turk 让大量此类物品变得非常便宜。

标签: algorithm web-crawler heuristics


【解决方案1】:

我相信您正在尝试文档分类,这是一个经过充分研究的主题。

http://en.wikipedia.org/wiki/Document_classification

您将看到许多不同方法的大量列表。但是在确定你所说的“趋势”之前建议其中任何一个(或神经网络等)是过早地建议它。我建议查看“网络文档分类”等。这显然是文档分类的一个相当大的子集,如果您可以访问学术期刊,那么有很多难以理解的文章供您欣赏。

我确实也发现了你的想法作为家庭作业——也许如果你特别大胆,你可以联系教授。 http://uhaweb.hartford.edu/compsci/ccli/wdc.htm

最后,我相信这是一个可访问(如果格式奇怪)的网站,其中包含一般性且可能已过时的讨论: http://www.webology.ir/2008/v5n1/a52.html

恐怕我对这个主题没有太多的个人知识,所以我能做的最多就是告诉你关键字“文档分类”并提供一些快速的谷歌搜索。但是,如果我想玩弄这个概念,我认为简单地寻找某些关键字的比率是一个不错的起始“趋势”。 (“销售”或“购买”或“客户”是购物网站的趋势,“我的”、“意见”、“评论”是博客等的趋势)

【讨论】:

    【解决方案2】:

    您可以训练 neural network 来识别它们。给它数量/类型的链接,也许还有 HTML 标签的类型。

    我认为否则你只会猜测是什么让一个网站成为什么样子。

    【讨论】:

    • 是的 - 我昨天开始构建神经网络.. 这是一个好主意。你会不会只给它 1000 个站点和类型作为输入,让它从中学习……然后再给它 1000 个……直到它学得足够多?
    • 我认为你只需要继续训练它,直到你得到可接受数量的误报。
    • 良好的机器学习实践是将您的数据划分为训练集和测试集(最好是开发集),以防止过度拟合。
    猜你喜欢
    • 2017-08-07
    • 1970-01-01
    • 2021-05-30
    • 2015-03-02
    • 2015-12-17
    • 1970-01-01
    • 1970-01-01
    • 2015-01-18
    相关资源
    最近更新 更多