【问题标题】:I want to know the Confusion matrix Steps我想知道混淆矩阵步骤
【发布时间】:2021-05-23 00:50:28
【问题描述】:

我已经完成了具有余弦相似度的计数矢量化器。接下来,我希望混淆矩阵得到精确度和准确度

但我不知道该怎么做 我非常感谢您的回答,即使它们只是步骤

如果有错误/没有描述问题,请告诉我

代码计数向量器

    c_vectorizer = CountVectorizer()
    c_vectorized = c_vectorizer.fit_transform(dataset_with_tags.movie_tags)
    c_vectorized_m2m = pd.DataFrame(cosine_similarity(c_vectorized))
    c_vectorized_m2m.head(10)

    c_vectorized_m2m_similarity = c_vectorized_m2m.stack().reset_index()
    c_vectorized_m2m_similarity.columns = ['first_movie', 'second_movie', 'similarity_score']
    c_vectorized_m2m_similarity.head(10)

【问题讨论】:

    标签: python jupyter-notebook dataset data-science recommendation-engine


    【解决方案1】:

    您似乎对混淆矩阵感到困惑:当您可以比较分类问题的实际值与预测值时,可以使用它,从而为您提供关于 类别 是否被正确识别的绝对真理(真/假)。例如如何generate a confusion matrix from the resultswith a classifier。

    https://en.wikipedia.org/wiki/Confusion_matrix

    相似度矩阵不进行分类,它们只是为您提供从 0 到 1 的连续值,表示 2 个事物的相似程度。 没有分类,因此不能使用混淆矩阵。

    您是想使用相似度矩阵(两个项目的相似程度)还是classifier(例如,电影是“喜剧”还是“戏剧”,电影可以有多种类型,例如“浪漫喜剧”,因此您需要一个多类分类器),您需要一些测试数据来评估模型的性能:

    • 相似度矩阵:相似/不相似的电影列表,并期望您的矩阵分别返回接近 1/0 的值
    • 分类器:假设您的数据集中的movie_tags 是准确的,您可以使用它们来训练您的分类器,并预测不在您的数据集中的电影的标签(您以后可以随时使用相似度矩阵根据这些预测的标签推荐类似的电影)。

    【讨论】:

      猜你喜欢
      • 2018-08-30
      • 2022-08-23
      • 1970-01-01
      • 2020-05-18
      • 2015-12-17
      • 2020-10-01
      • 2012-01-20
      • 2019-11-23
      • 1970-01-01
      相关资源
      最近更新 更多