【发布时间】:2021-03-18 15:17:47
【问题描述】:
我有一个列表列表,其中每个内部列表都是一个标记化的文本,因此它的长度是文本中的单词数。
corpus = [['this', 'is', 'text', 'one'], ['this', 'is', 'text', 'two']]
现在,我想创建一个包含语料库中所有唯一标记的集合。对于上面的示例,所需的输出将是:
{'this', 'is', 'text', 'one', 'two}
目前,我有:
all_texts_list = list(chain(*corpus))
vocabulary = set(all_texts_list)
但这似乎是一种内存效率低下的方式。
有没有更有效的方法来获取这个集合?
我找到了this link。但是,他们希望找到唯一列表的集合,而不是列表中的唯一元素集合。
【问题讨论】:
标签: python-3.x list set