【发布时间】:2018-04-04 22:28:17
【问题描述】:
我正在尝试使用编码器对数据集进行聚类,由于我是该领域的新手,所以我不知道该怎么做。我的主要问题是如何定义损失函数,因为数据集没有标记并且知道,什么我从参考书目中看到,他们将期望输出和预测输出之间的距离定义为损失函数。我的问题是,既然我没有期望的输出,我应该如何实现这个?
【问题讨论】:
标签: cluster-analysis autoencoder loss-function
我正在尝试使用编码器对数据集进行聚类,由于我是该领域的新手,所以我不知道该怎么做。我的主要问题是如何定义损失函数,因为数据集没有标记并且知道,什么我从参考书目中看到,他们将期望输出和预测输出之间的距离定义为损失函数。我的问题是,既然我没有期望的输出,我应该如何实现这个?
【问题讨论】:
标签: cluster-analysis autoencoder loss-function
您可以使用自动编码器来预训练您的卷积层,就像我在问题 here 中描述的那样,对图像使用卷积自动编码器
正如你在表单代码中看到的,损失函数是 Adam,具有度量准确度和骰子系数,我认为你只能使用准确度,因为骰子系数是特定于图像的
我不确定它将如何为您工作,因为您还没有提供如何将参考书目列表转换为矢量的想法,也许您会为参考书目 ID 创建一个列表,按它们之间的余弦距离排序
例如,您可以为数据集中的每个参考文献使用一组与上述参考书目列表中每个项目的余弦距离的向量,并将其用作自动编码器的输入
编码器经过训练后,您可以从模型输出中移除解码器部分,并将其用作无监督聚类算法之一的输入,例如 k-mean。你可以找到他们的详细信息here
【讨论】: