【问题标题】:Identify trending topics in Twitter识别 Twitter 中的热门话题
【发布时间】:2015-09-10 19:42:09
【问题描述】:

我正在使用 spark 流传输实时推文(过滤器,仅英文推文)并将它们存储在 Cassandra 中,然后我计划运行 K-means/LSI 算法(使用 spark MLib)来识别趋势主题。

我需要有关如何以矩阵(向量)表示形式表示这些推文的提示。此外,我想知道用存储的数据训练模型然后用流数据运行模型是否正确?

【问题讨论】:

    标签: twitter machine-learning apache-spark k-means spark-streaming


    【解决方案1】:

    这完全取决于您使用的功能和您使用的语言。

    您可以将其表示为一个向量,其中所有单词为列,每个值都在 1 和 0 之间,使用某种度量标准,例如 TFIDF。然后在常规 RDD(或稀疏)上执行 k-means

    https://spark.apache.org/docs/1.1.0/mllib-clustering.html

    https://spark-summit.org/2014/wp-content/uploads/2014/07/sparse_data_support_in_mllib1.pdf

    【讨论】:

    • 我考虑过使用 TF-IDF 标准化,但是我应该先将流存储到 Cassandra 中,然后再执行 TF-IDF 吗?两个链接都失效了!
    • 嗯,您可以即时计算 TF,因为您从高音扬声器获取信息,因为这是每个 twitter 的本地统计信息。 IDF 使用文档的总数和每个术语的文档。所以......理论上你也可以即时更新这个值(全局变量)。可能您需要设置封闭时间段(每天、每小时),以便您可以正确地 k 表示信息。
    猜你喜欢
    • 1970-01-01
    • 2015-03-08
    • 2017-10-07
    • 2013-05-24
    • 1970-01-01
    • 2010-11-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多