【问题标题】:RapidMiner: Calculate document similarityRapidMiner:计算文档相似度
【发布时间】:2023-03-24 05:07:02
【问题描述】:

我正在使用 Rapidminer 来计算文档之间的相似度。我正在我的 Java 应用程序 中使用此过程。

此过程计算每个文档与数据集中所有其他文档的相似度。我不想计算每个文档之间的相似性。 我只想计算一个选定文档与所有其他文档的相似度。

Process Document 为我提供了一个带有 tf-idf 分数的词向量。
Data to Similarity 计算这些向量之间的 余弦相似度

所以基本上我需要计算一个选定文档与数据集中所有其他文档的余弦相似度。

RapidMiner 可以吗?任何见解都会有所帮助。谢谢。

编辑:
回答:

【问题讨论】:

    标签: rapidminer


    【解决方案1】:

    Cross Distances 运算符会更好。它需要两个输入,它们都是示例集。第一个可以是所有文档的特征列表,第二个可以是单个文档的特征列表。结果是一个带有距离计算的新示例集。如果您对这个示例集进行排序(操作员可能已经返回了一个排序列表,但以防万一您可以使用Sort)找到这个最小值并使用Filter Example Range 选择它,您将获得最近文档的详细信息。

    【讨论】:

    • 当我尝试使用这种类似方法时,远处出现问号?关于寻找什么的任何建议?
    • 我建议发布一个包含足够详细信息的新问题,以便重现问题。
    猜你喜欢
    • 2019-10-23
    • 2020-01-25
    • 1970-01-01
    • 1970-01-01
    • 2020-03-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-02-03
    相关资源
    最近更新 更多