【发布时间】:2021-10-21 14:12:30
【问题描述】:
我的问题不是关于特定的代码问题,而是关于应对自然语言处理挑战的最佳方向。
一方面,我收集了数百个 Word 和 PDF 文件(然后我可以从中导出原始文本),另一方面还有一个术语列表。术语可以包含一个或多个单词。我需要做的是确定每个术语在哪些文件中使用,应用词干提取和词形还原。
我将如何最好地解决这个问题?我知道如何提取文本、应用标记化、词形还原等,但我不确定如何在文档语料库中搜索词形还原形式出现的术语。
欢迎任何提示。
谢谢!
【问题讨论】:
标签: python nlp lemmatization