【问题标题】:Web Crawling and Pagerank网络爬虫和Pagerank
【发布时间】:2015-02-17 19:20:34
【问题描述】:

我是一名计算机科学专业的学生,​​在网络抓取和构建搜索引擎方面我有点缺乏经验。目前,我正在使用最新版本的 Open Search Server 并爬取数千个域。当使用内置的搜索引擎创建工具时,我会得到与我的查询相关的搜索结果,但它们是使用文档的向量模型而不是 Pagerank 算法或类似的东西来排名的。因此,排名靠前的结果只提供了微不足道的帮助,而来自 Wikipedia 等网站的高质量结果则隐藏在第二页。

有没有办法在 Open Search Server 中运行粗略的 Pagerank 算法?如果没有,是否有类似的易于使用的开源软件包可以做到这一点?

感谢您的帮助!这是我第一次做这样的事情,所以非常感谢任何反馈。

【问题讨论】:

    标签: search web-crawler pagerank search-engine-bots


    【解决方案1】:

    我不熟悉开放式搜索服务器,但我知道大多数从事搜索引擎工作的学生使用Lucene或Indri。阅读有关文档搜索新方法的论文,您会发现其中大多数都使用这两个 API 之一。 Lucene 在定义不同等级算法方面比 indri 更灵活。我建议看看这两个,看看它们是否适合您的目的。

    【讨论】:

    • 谢谢!今晚我会调查一下。
    【解决方案2】:

    正如您提到的,OpenSearchServer 的网络爬网模板使用基于向量空间模型的具有相关性的搜索查询。但是如果你使用上一个版本(v1.5.11),它也会混合反向链接的数量。

    您可以根据反向链接更改分数的权重,默认设置为 1。

    我们目前正在努力提供对相关性的更多控制。这将在 OpenSearchServer 的未来版本中可见。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-12-11
      • 1970-01-01
      • 1970-01-01
      • 2018-08-12
      • 2012-08-01
      • 2015-05-12
      • 2013-03-29
      • 1970-01-01
      相关资源
      最近更新 更多