【问题标题】:Extract topics from SMS messages从 SMS 消息中提取主题
【发布时间】:2018-01-27 21:14:45
【问题描述】:

我有一个格式错误且稀疏的 SMS 消息数据集。我尝试使用主题建模来获取每条消息中所有可能的主题以及每个相关主题的概率。我需要能够排列或排列每条消息的主题的概率。

我正在考虑的替代解决方案是手动标记我的数据集并使用监督分类算法,例如朴素贝叶斯。 以下是我的 SMS 消息示例,这些消息稀疏且包含垃圾邮件内容,因此我认为主题建模效果不佳:

我面临的挑战:

  1. 使用监督分类方法的替代方法是否合理,或者我应该保留像主题建模这样的无监督方法?

  2. 我应该如何处理数据集:每条消息应该有一个类别作为标签还是我可以分配多个类别?

  3. 这是多标签还是多类分类问题?

【问题讨论】:

    标签: machine-learning text-classification topic-modeling multilabel-classification multiclass-classification


    【解决方案1】:

    如果您知道主题是什么,请使用有监督的朴素贝叶斯。无监督学习可用于类别发现。

    为一个样本分配多个主题不是问题。

    朴素贝叶斯根据概率最高的主题为样本分配标签。当然,您可以使用最高 x 概率(可能带有阈值)来分配多个主题。

    【讨论】:

    • 所以为了确保我做对了如果我手动标记数据,我必须给它超过 1 个标签用于训练?正如你所说,我可以使用对朴素贝叶斯的破解来使用最高 x 主题?
    • 我已经附上了我的数据集的副本,看看它是多么稀疏和格式错误,我想确保选择不使用主题建模是否正确?因为它是一组 5000消息所以手动标记不是最好的事情
    猜你喜欢
    • 2021-12-13
    • 2019-08-24
    • 1970-01-01
    • 2022-08-18
    • 2015-08-01
    • 1970-01-01
    • 1970-01-01
    • 2019-10-14
    • 2015-11-17
    相关资源
    最近更新 更多