【问题标题】:How is an aggregator built? [closed]聚合器是如何构建的? [关闭]
【发布时间】:2010-10-30 00:43:36
【问题描述】:

假设我想从许多来源(可能是旅行、技术或其他)汇总与特定利基市场相关的信息。 我该怎么做?

有一个蜘蛛/爬虫会爬网以找到我需要的信息(我如何告诉爬虫爬什么,因为我不想获取整个网络?)? 然后有一个索引系统来索引和组织我爬取的信息,同时也是一个搜索引擎?

像 Nutch lucene.apache.org/nutch 这样的系统可以用于我想要的吗?你推荐别的东西吗?

或者你能推荐另一种方法吗?

例如,Techmeme.com 是如何构建的? (它是技术新闻的聚合器,并且是完全自动化的——直到最近他们才增加了一些人工干预)。 构建这样的服务需要什么?

或者 Kayak.com 如何汇总他们的数据? (这是一个旅游聚合服务。)

【问题讨论】:

    标签: web-services aggregation web-crawler nutch


    【解决方案1】:

    您需要定义您的应用程序将要做什么。构建自己的网络爬虫是一项艰巨的任务,因为您往往会在发现需要它们时不断添加新功能......只是为了使您的设计复杂化等等......

    构建聚合器有很大不同。 爬虫只是简单地检索待处理的数据,而聚合器获取已定义的数据集并将它们放在一起。如果您使用聚合器,您可能希望查找已定义的旅行提要、财务提要、旅行数据等...聚合器更容易构建 IMO,但受到更多限制。

    如果您想要构建一个爬虫,则需要定义起始页面、定义结束条件(爬取深度、时间等)等等,然后仍然处理数据(即聚合,总结等等)。

    【讨论】:

      【解决方案2】:

      这一切都取决于您正在寻找的聚合器。

      类型:

      • 定义模糊 - 通常这要求您的数据源非常灵活地确定信息收集的类型(回答此站点/信息是否与旅行相关?幽默?与业务相关?)
      • 特定 - 这放宽了数据存储中的要求,即所有数据都专门针对航班、酒店价格等与旅行相关的要求。

      通常,聚合器是子程序的系统:

      1. Grabber,这会搜索并抓取所有需要汇总的内容
      2. 汇总 - 这通常通过查询数据库来完成,并且可以根据用户偏好[通过编程逻辑]进行调整
      3. 查看 - 这会格式化用户希望看到的信息,并可以响应用户对建议项目的喜欢或不喜欢的反馈。

      【讨论】:

        【解决方案3】:

        对于基本外观 - 看看这个:http://en.wikipedia.org/wiki/Aggregator

        它将为您提供对聚合器的总体概述。

        关于如何构建自己的聚合器,如果您正在寻找开箱即用的东西,可以为您提供您想要的内容 - 我建议:http://dailyme.com/

        如果您正在寻找一个代码库/架构来构建您自己的聚合服务 - 我建议直接看一些东西 - 例如:从http://www.reddit.com/打开 Reddit

        【讨论】:

        • 是的,我想要自己的聚合器。 Reddit 就像一个 Digg 网站,这意味着用户将提交链接并对其进行投票(Pligg 或 SocialWebCMS 也是允许您构建类似 Digg 的软件)。我想要的更像是 Techmeme(新闻是自动收集的,如果需要,编辑可以在网站上排名或展示它们)。
        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2011-08-14
        • 2010-10-12
        • 1970-01-01
        • 2010-10-18
        • 2021-07-21
        相关资源
        最近更新 更多