【发布时间】:2020-01-08 17:47:08
【问题描述】:
我想为我的训练数据中的三个不同标签创建一个特定否定词列表。这个词应该只出现在一个特定的标签上,而不是三个。我有一个包含 3 列的数据框:id、句子、标签
我还有 2 个不同的阳性词典文件(均采用词形还原形式)
我想为每个标签创建单词列表
到目前为止,我成功地创建了为每个句子显示否定词的列。但我无能为力之后如何选择和提取每个标签唯一的单词。这意味着仅出现在标记为三个类别之一的句子中的单词。
总结一下:我想创建一个我的单词词典中的单词列表,这些单词出现在标记为 A、B 或 C 的句子中。这些单词对于每个类应该是唯一的,如预期输出列表中所示
下面的数据文件
我的脚本的部分脚本(我只是用否定词放了例子)
lexiconneg = lexiconneg_feel['Word'].values # a list of negative word
print(lexiconneg)
def extract_word_neg(text, word_list):
text_list = tokenize_lemmatize_spacy(text) # call tokenize and lemmatisation function using spacy
intersection = [w for w in text_list if w in word_list]
return intersection
datafile['list_mots_négatifs'] = datafile['phrases'].apply(extract_word_neg, args= (lexiconneg, ))
datafile.to_excel('négatif_mots.xlsx')
在下面应用脚本后的数据文件
因此,对于我的示例,我将得到以下列表作为预期结果:
A= problème, polluer, corrosif, pouvoir, sujet
B= contrer, extrémité, bouillir
C= vider pression
【问题讨论】:
标签: python list dataframe nlp lemmatization