【发布时间】:2022-01-02 10:42:34
【问题描述】:
我在熊猫数据框中有一些文本df['mytext']
我还有一个词汇表vocab(单词列表)。
我正在尝试列出并计算每个文档的词汇表中的单词
我尝试了以下方法,但对于 10k 文档来说速度很慢。
如何快速有效地量化 pandas 文本集合中的词汇表外标记?
OOV_text=df['mytext'].apply(lambda s: ' '.join([ word for word in s.split() if (word not in vocab) ]))
OOV=df['mytext'].apply(lambda s: sum([(word in vocab) for word in s.split()])/len(s.split()))
df.shape[0] 相当大 len(vocab) 很大 len(df.mytext 中的唯一词)
【问题讨论】:
-
您是否必须知道每一行的计数,或者您可以为整个 DF 做到这一点?
-
我需要逐行量化
标签: python pandas nlp vocabulary