【问题标题】:Optimal Document Size for LSI Similarity ModelLSI 相似性模型的最佳文档大小
【发布时间】:2018-01-16 07:27:11
【问题描述】:

我正在使用 Gensim 的优秀库来计算使用 LSI 的语料库上的相似性查询。但是,我有一种明显的感觉,结果可能会更好,我正在尝试弄清楚我是否可以调整语料库本身以改善结果。

我对如何拆分文档有一定的控制权。我的原始数据有很多非常短的文档(平均长度是文档中的 12 个单词,但是存在 1-2 个单词长的文档......),并且有几种逻辑方法可以将多个文档连接成一个。问题是我不知道这样做是否值得(如果值得,在多大程度上)。我找不到任何材料来解决这个问题,但只能找到语料库的大小和词汇量的大小。我认为这是因为归根结底,文档的大小受词汇量的限制。但我确信仍有一些通用准则可以帮助您做出此决定。

什么被认为是太短的文档?什么是太长了? (我假设后者是|V| 的函数,但前者很容易成为一个常数值。)

有人有这方面的经验吗?谁能指出我解决这个问题的任何论文/博客文章/研究的方向?非常感谢!

编辑添加: 关于对文档进行分组的策略 - 每个文档都是两方之间发送的文本消息。潜在的分组基于此,我还可以考虑发送消息的时间。意思是,我可以将 A 和 B 在某个小时内或某天发送的所有消息分组,或者只是将两者之间的所有消息分组。我还可以决定组合在一起的消息的最小或最大数量,但这正是我的问题所在 - 我怎么知道理想的长度是多少?

【问题讨论】:

    标签: gensim lsa


    【解决方案1】:

    在我看来,查看每个文档的字数并不是正确的方法。 LSI/LSA 就是通过检测常见的共现来捕获文档的底层语义

    您可能想阅读:

    1. LSI: Probabilistic Analysis
    2. Latent Semantic Analysis(特别是第 3.2 节)

    来自2的有效摘录:

    LSI 的一个重要特点是它不做任何假设 关于数据背后的特定生成模型。无论 语料库中术语的分布是“高斯”、泊松或 其他一些与这种技术的有效性无关,在 至少就其数学基础而言。因此,它是 说使用 LSI 需要假设属性是不正确的 值是正态分布的。

    我更担心的是,如果短文档共享相似的共同出现的术语,这将允许 LSI 形成一个适当的主题,将人类共享相同主题的所有文档分组。这很难通过用更频繁和通用的术语替换稀有术语来自动完成(可能使用 WordNet / 本体)。但这是一个非常漫长的过程,需要进一步研究。

    关于启发式的更具体答案:
    我最好的选择是将对话视为您的文件。因此,分组将在交换消息的时间接近度上进行。几分钟(四分之一?)我会聚在一起。虽然可能存在误报(很大程度上取决于数据集的实际内容)。与 NLP 中的任何超参数一样 - 你的里程会有所不同......所以值得做一些实验。

    【讨论】:

    • 我还没有时间阅读您的链接,但您可能需要注意它们是相同的。你的意思是放两个不同的链接吗?
    • 您关于检测常见共现的说法与长度问题并不矛盾。例如,如果所有文档的长度都为 2,那么共现就没有多大意义。相似性,如果文档很长,太多的词会相互共现,使得高共现不那么重要。
    • 同意。我的观点更多的是关注文档长度的分布,而似乎与 LSI 重要的是文档中有意义的(与发现的主题不同)共现,无论它们的长度如何。您的长度为 2 的文档的边缘情况是有效的,但我希望 - 在您的文档集中很少见。否则,使用 LSI 似乎没有多大意义(如果您的大多数文档中有 2 个单词)。其他方法似乎更适合我。
    • 也许在我的语料库中了解文档长度的差异是一个错误。这与问题无关。关键是我的文件很短,问题是我是否应该调整语料库以使文件更大——如果是,调整到什么程度。我将编辑问题以澄清这一点。
    • 好的,改写是个好主意。谈到对语料库的调整——将文档粘合在一起的标准是什么?在我看来,您打算使用自动主题建模方法 (LSI),同时手动完成一些工作(根据主题对文档进行分组)。嗯...这对 LSI 有帮助吗?可能。根据您希望从 LSI 获得的主题数量,共现可能会过度分布在许多短文档中以形成有意义的主题。您至少需要一些较长的文件,它们与短文件共享条款。
    【解决方案2】:

    在应用 LDA 时,短文档确实是一个挑战,因为对于短文档(稀疏数据),单词共现统计的估计值要差得多。正如您所提到的,缓解此问题的一种方法是通过某种启发式措施以某种方式将多个短文本聚合到一个较长的文档中。

    针对这种情况的一个很好的特殊测试用例是 Twitter 数据的主题建模,因为它被定义限制为 140 个字符。在Empirical Study of Topic Modeling in Twitter(Hong et al, 2010)中,作者认为

    在聚合的用户消息上训练标准主题模型会导致 更快的训练过程和更好的质量。

    不过,他们也提到不同的聚合方法会导致不同的结果:

    使用不同的聚合策略学习的主题 这些数据彼此之间存在很大差异。

    我的建议:

    1. 如果您使用自己的启发式方法将短消息聚合成较长的文档,请务必尝试不同的聚合技术(可能是所有“有意义的”技术)

    2. 考虑使用更适合短消息的“无启发式”LDA 变体,例如 Unsupervised Topic Modeling for Short Texts Using Distributed Representations of Words

    【讨论】:

    • 我说的是 LSI 而不是 LDA,但乍一看,我认为您所说的一切也与 LSI 相关。无论如何,我期待着阅读这篇文章。希望它能让我朝着正确的方向前进。
    猜你喜欢
    • 2013-12-22
    • 2021-03-14
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-06-09
    • 2020-09-07
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多