【发布时间】:2011-03-23 11:04:19
【问题描述】:
我需要从给定文本中提取所有英语动词,我想知道我该怎么做... 乍一看,我的想法是使用正则表达式,因为所有英语动词时态都遵循模式,但也许还有另一种方法。我的想法很简单:
- 为每个动词时态创建一个模式。我必须以某种方式区分规则动词 (http://en.wikipedia.org/wiki/English_verbs) 和不规则动词 (http://www.chompchomp.com/rules/irregularrules01.htm)。
- 遍历这些模式并使用它们拆分文本(每个子字符串的最后一个单词应该是赋予句子完整含义的动词,我需要它用于其他目的 -> 名词化)
你怎么看?我想这不是一种有效的方法,但我无法想象另一种方法。
提前谢谢你!
PS:
- 我有两本词典,一本用于所有英语动词,另一本用于所有英语名词
- 这一切的主要问题是该项目包括动词名词化(只是一个uni项目),所以所有的“努力”都应该集中在这部分,名词化。具体来说,我遵循这个模型:acl.ldc.upenn.edu/P/P00/P00-1037.pdf)。该项目包括给定一个文本,找到该文本中的所有动词,并为每个动词提出多个名词化。所以第一步(找动词),应该尽量简单……但我不能使用任何解析器,这是不允许的
【问题讨论】: