【发布时间】:2013-02-20 16:09:22
【问题描述】:
需要帮助和建议。已经设置了一个带有 mahout 集群的 5 hadoop
我有两组数据:
表 1:id1,地址 1
表 2:id2,地址 2
如何使用 mahout 查找相似性评分,以便它比较两个文件中的地址,以便我得到以下结果?
结果:地址1,地址2,分数
已完成:
将文件合并到一个 csv
转换为序列文件:seqdirectory,
- 向量化:seq2sparse (-wt tfidf)
不完全确定之后该去哪里。推荐或聚类。如何使用jaccard索引等需要指针和例子。
【问题讨论】:
标签: mahout