【发布时间】:2010-08-13 20:19:05
【问题描述】:
我正在解析句子。我想知道每个句子的相关内容,松散地定义为与语料库其余部分相关的“半唯一词”。类似于亚马逊的“统计上不可能的短语”,似乎(经常)通过奇怪的词串来传达一本书的特征。
我的第一步是开始制作一个常用单词列表。这淘汰了a、the、from 等简单的列表。显然,这个列表变得很长。
一个想法是生成这个列表:制作语料库词频的直方图,并去掉前 10% 或类似的东西(IE the 出现 700 次,from 600 次,但 micropayments只有 50 个,低于临界值,因此是相关的)。
我今天刚刚从 Hacker News 了解到的另一个算法是 Tf idf,看起来它可能会有所帮助。
还有什么方法比我的两个想法更有效?
【问题讨论】:
标签: algorithm parsing language-agnostic lexical-analysis