【问题标题】:Automatic Topic Labeling Evaluation metric自动主题标签评估指标
【发布时间】:2023-03-25 01:05:01
【问题描述】:

我正在尝试对大型研究论文数据集进行主题标记问题。我的想法是我可以给每篇论文一些相关的标签。

我有 2 个问题。

我知道您可以通过多种方式进行主题建模,例如使用 LDA 和 NMF,但是您可以做些什么来稍后从这些主题中提取可能的标签?

另外,假设我提取了一堆标签,我如何从数学上估计它们的准确性?是否有某种可用的度量标准可以确定文档中的标签所解释的信息的差异,或者类似的东西?如果没有一大群人进行定性分析,我将如何评估我的标签?

【问题讨论】:

    标签: python nlp topic-modeling


    【解决方案1】:

    最简单的方法是使用前k个单词作为标签。更复杂的方法包括候选标签生成和候选标签排序。许多相关论文都在谈论这个话题:

    1. Aletras、Nikolaos 和 Mark Stevenson。 “使用无监督的基于图的方法标记主题。”访问控制列表。 2014
    2. Bhatia、Shraey、Jey Han Lau 和 Timothy Baldwin。 “使用神经嵌入自动标记主题。”科林(2016 年)。
    3. Hingmire、Swapnil 等人。 “按主题标记的文档分类。”西吉尔。 2013

    以上所有论文都有讨论如何评估标签的部分。

    【讨论】:

      猜你喜欢
      • 2015-11-30
      • 1970-01-01
      • 2015-02-28
      • 1970-01-01
      • 1970-01-01
      • 2020-06-26
      • 2011-04-18
      • 1970-01-01
      • 2014-05-18
      相关资源
      最近更新 更多