【问题标题】:Realtime data processing with Python使用 Python 进行实时数据处理
【发布时间】:2013-06-18 15:53:34
【问题描述】:

我正在做一个项目,该项目将使用来自 Twitter Stream API 的数据并计算某些主题标签。但是我很难理解我需要什么样的架构。我应该使用 Tornado 还是有更合适的框架?

【问题讨论】:

    标签: python real-time tornado


    【解决方案1】:

    这真的取决于你想用推文做什么。简单地阅读推文流并不是我见过的问题。事实上,这可以在 AWS 微实例上完成。我什至在实时提要上运行更高级的回归算法。如果您尝试处理一组历史推文,则会出现可伸缩性问题。由于推文的生成速度如此之快,因此处理历史推文可能会非常缓慢。这时候你应该尝试并行化。

    【讨论】:

    • 感谢您的回复。现在我要阅读一个流,假设每 30 分钟计算一次新消息。这是我理解应该在哪里运行检索和存储消息的问题。
    • 如果你只关心带有特定标签的推文,你可能想要在推文进入时进行过滤。事实上,如果你不关心推文的其余部分,你应该只需写一个计数表。我发现处理大量数据的关键是在摄取时将其减少到您真正需要的数据。对这些数据的任何分析都是非常轻量级的。当然,这意味着您需要决定您需要和不需要哪些信息。
    猜你喜欢
    • 2017-11-03
    • 2011-10-01
    • 2017-03-16
    • 1970-01-01
    • 1970-01-01
    • 2018-03-05
    • 2011-02-26
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多