【问题标题】:How can I find only 'interesting' words from a corpus?我怎样才能从语料库中只找到“有趣”的词?
【发布时间】:2010-08-13 20:19:05
【问题描述】:

我正在解析句子。我想知道每个句子的相关内容,松散地定义为与语料库其余部分相关的“半唯一词”。类似于亚马逊的“统计上不可能的短语”,似乎(经常)通过奇怪的词串来传达一本书的特征。

我的第一步是开始制作一个常用单词列表。这淘汰了athefrom 等简单的列表。显然,这个列表变得很长。

一个想法是生成这个列表:制作语料库词频的直方图,并去掉前 10% 或类似的东西(IE the 出现 700 次,from 600 次,但 micropayments只有 50 个,低于临界值,因此是相关的)。

我今天刚刚从 Hacker News 了解到的另一个算法是 Tf idf,看起来它可能会有所帮助。

还有什么方法比我的两个想法更有效?

【问题讨论】:

    标签: algorithm parsing language-agnostic lexical-analysis


    【解决方案1】:

    看看this article单词级别统计:在文学文本和符号序列中寻找关键字,发表于Phys. Rev. E)。 p>

    第一页上的图片及其标题解释了关键的观察结果。在堂吉诃德中,“but”和“Quixote”这两个词出现的频率相似,但它们的频谱却大不相同(“Quixote”的出现是聚集的,而“but”的出现间隔更均匀) .因此,“Quixote”可以归类为有趣的词(关键字),而“but”则被忽略。

    它可能是也可能不是您正在寻找的东西,但我想熟悉这个结果不会有什么坏处。

    【讨论】:

    • 在达尔文的书上效果很好,但在乔伊斯的尤利西斯上,它产生了一些不太有用的结果:我说,说,你,她,她,布卢姆,先生,项目,我.. . 是前十个单词。如果你延伸到下一个四十,你会得到: mulligan, is, joe, buck, he, was, it, which,citizen, eglinton, douce, my, like, j, cissy, o, we, tap, omolloy, deasy ,那个,也有,alf,conmee,gutenberg,haines,myles,martin,kennedy,out,他的,你的,他们,ned,gerty,hes,lenehan,edy……顺便说一句,我意识到我没有t 剥离古腾堡计划的 logorrhea 不够好!!
    【解决方案2】:

    我认为亚马逊所谓的“Statistical Improbable Phrases”是在其庞大的数据语料库中不太可能出现的词。实际上,即使一个单词在给定的书 A 中重复了 1000 次,如果该书是它出现的唯一地方,那么它就是一个 SIP,因为它出现在任何给定的书中的概率是 zilch(因为它是特定于 A 书)。除非您自己处理大量数据,否则您无法真正复制这些丰富的数据来比较信息。

    什么是大量数据?好吧,如果您正在分析文学文本,那么您可能希望从 Gutenberg 下载并处理几千本书。但是,如果您正在分析法律文本,那么您必须专门输入法律书籍的内容。

    如果(可能是这种情况)您没有大量数据作为奢侈品,那么您必须以一种或另一种方式依赖频率分析。但不要考虑相对频率(通常认为的文本分数),而是考虑绝对频率。

    例如,hapax legomenon 在网络分析领域也被称为 1-mice,可能会引起特别的兴趣。它们是在给定文本中只出现一次的单词。例如,在詹姆斯乔伊斯的尤利西斯中,这些词只出现过一次:postexilic、corruption、romanys、macrocosm、diaconal、compressibility、aungier。它们不是统计上不可能的短语(就像“Leopold Bloom”一样),因此它们不代表这本书。但它们是非常罕见的术语,它们只在作者的表达中出现一次,所以你可以认为它们在某种程度上表征了他的表达。与“the”、“color”、“bad”等常用词不同,这些词是他明确尝试使用的。

    所以这些是一个有趣的工件,问题是,与其他更复杂的指标不同,它们很容易提取(想想具有恒定内存的 O(N))。 (如果您想要更频繁的元素,那么您可以使用同样容易提取的 2-mice、...、10-mice。)

    【讨论】:

      【解决方案3】:

      TF-IDF 是一种方法。如果你想谈论句子而不是单词,除了上面的优秀参考资料,这里有一个简单的方案:

      从一个大样本语料库创建一个markov chain。简而言之,您通过记录输入文本中每个 n 元组的频率来构建马尔可夫链。例如,带有 3 元组的句子“这是一个测试”将是 (this, is, a), (is, a, test)。然后,您将每个 n 元组按前 n-1 项分组,让您回答“给定前面的 n-1 个单词,下一个单词是这个的概率是多少?”

      现在,对于输入文档中的每个句子,遍历马尔可夫链。通过将遍历链时遇到的所有概率相乘来计算看到句子的概率。这使您可以估计该句子在输入语料库中的“可能性”程度。您可能希望将此概率乘以句子的长度,因为在统计上,较长的句子不太可能。

      现在您已将输入中的每个句子关联到一个概率。选择 n 个最不可能的句子 - 这些是“有趣”的句子,用于某些有趣的定义。

      【讨论】:

      • +1 这听起来很有趣。你能把论文给我吗?
      【解决方案4】:
      猜你喜欢
      • 1970-01-01
      • 2022-08-19
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-01-28
      相关资源
      最近更新 更多