【发布时间】:2019-01-10 12:49:44
【问题描述】:
我有一个巨大的df,其中有一个doc_id 和word,每个word 可以包含多个class(Class_1,Class_2,Class_3 ),所以如果一个词在那个class 中,我把1 放在那里或者如果然后不是0
样本 DF
doc_id word Class_1 Class_2 Class_3
104 saturn 1 0 1
104 survival 1 1 0
104 saturn 1 0 1
104 car 0 1 0
118 baseball 1 1 0
118 color 0 0 1
118 muscle 0 1 0
187 image 1 0 0
187 pulled 0 0 0
187 game 1 0 1
187 play 0 0 1
187 game 1 1 0
125 translation 1 0 0
125 survival 0 1 0
125 input 1 0 1
125 excellent 1 0 0
142 nice 0 1 0
142 article 0 1 0
142 original 1 0 1
142 content 0 1 0
现在使用这个sample DF 我想count 在class(Class_1,Class_2,Class_3) 中出现word 的次数。
每个class(Class_1,Class_2,Class_3)、eg: 中的总字数比如Class_1 中有多少words
最后在所有文档中总计unique words。
OUTPUT DF应该是这样的
doc_id word Occ_1 Occ_2 Occ_3 Totl_1 Totl_2 Totl_3 Unique_words
104 saturn 2 0 2 11 9 7 17
104 survival 1 2 0 11 9 7 17
104 car 0 1 0 11 9 7 17
118 baseball 1 1 0 11 9 7 17
118 color 0 0 1 11 9 7 17
118 muscle 0 1 0 11 9 7 17
187 image 1 0 0 11 9 7 17
187 pulled 0 0 0 11 9 7 17
187 game 2 1 1 11 9 7 17
187 play 0 0 1 11 9 7 17
125 translation 1 0 0 11 9 7 17
125 input 1 0 1 11 9 7 17
125 excellent 1 0 0 11 9 7 17
142 nice 0 1 0 11 9 7 17
142 article 0 1 0 11 9 7 17
142 original 1 0 1 11 9 7 17
142 content 0 1 0 11 9 7 17
而Occ_1 = Class_1 中的单词出现次数,其他 Class_2 和 Class_3 相同Totl_1 = @987654345 中的总单词@ 和其他 Class_2 和 Class_3Unique_words 相同 = 所有文档中唯一单词的总数
【问题讨论】:
标签: r dplyr data.table tidyverse tidytext