【发布时间】:2018-12-28 00:57:58
【问题描述】:
我目前正在研究评估学生对考试问题的回答的神经网络。因此,需要对 Word2Vec 网络的语料库进行预处理。德语文本中的连字符很常见。主要有两种不同类型的断字:
1) 行尾:
The text reaches the end of the line so the last word is sepa-
rated.
2) 枚举的简写形式:
如果有两个“元素”:
Geistes- und Sozialwissenschaften
更多“元素”:
Wirtschafts-, Geistes- und Sozialwissenschaften
这些枚举的去连字符形式应该是:
Geisteswissenschaften und Sozialwissenschaften
Wirtschaftswissenschaften, Geisteswissenschaften und Sozialwissenschaften
我需要删除所有连字符并将单词重新组合在一起。对于第一个问题,我已经找到了几种解决方案。
但我完全不知道如何获得枚举问题中单词的第二部分(在上面的示例中为“wissenschaften”)。我什至不知道这是否可能。
希望我能正确指出我的问题。
那么有人知道如何解决这个问题吗?
非常感谢您!
【问题讨论】:
标签: python nlp word2vec preprocessor hyphenation