【发布时间】:2017-02-24 21:26:10
【问题描述】:
我正在关注 Spark 文档中的 this example,用于计算一堆文档的 TF-IDF。 Spark 使用散列技巧进行此计算,所以最后你会得到一个包含散列单词和相应权重的向量,但是......我怎样才能从散列中取回单词?
我真的必须对所有单词进行哈希处理并将它们保存在地图中以便以后遍历它以查找关键字吗?有没有更高效的方式内置 Spark?
提前致谢
【问题讨论】:
标签: java hash apache-spark tf-idf