【发布时间】:2011-05-09 01:18:59
【问题描述】:
我正在做一个项目,其中我必须从文本文件(.doc)格式中提取名词形容词名词短语和动词。 我有大约 75 个此类文件的语料库。我已经访问了网络以查找它,并且我遇到了使用 nltk 在 python 中进行 POS 标记。 因为我的项目在 c# 中(使用 Visual Studio 2008),所以我需要一个代码来执行此操作。 我已经尝试过相同的 wordnet api 甚至是sharpnlp,但由于我是新手,我发现这些很难与我的项目集成。 任何人都可以建议我使用词汇等更简单的代码来做到这一点。请帮助我。 谢谢。
【问题讨论】:
-
这是一个独立的研究领域。不确定是否有任何易于使用的 C# 库。可以在barbar.cs.lth.se:8081 找到在线资源的示例(我认为它是开源的),更多信息请在code.google.com/p/mate-tools 找到。但是,这不是在 C# 中完成的,但也许可以提供一些想法。
-
我使用了几年前您在学校项目中提到的 SharpNLP。我记得它工作得很好,所以我绝对建议你检查一下。如果您不熟悉自然语言解析,则需要花一些时间来理解解析树等。codeproject.com/KB/recipes/englishparsing.aspx
-
@Ozzy 我不认为 OP 担心解析,标记通常在解析之前(并且在标记化之后),所以如果他只需要 POS 标签,他永远不必担心它。