【发布时间】:2020-10-31 17:32:49
【问题描述】:
将 unnest_tokens 函数应用于推文会创建 1 列,其中每个单词在其自己的行中。我在每条推文的原始数据框中(天、小时、分钟)都有额外的列。有没有办法让每行单词也有三个对应的单词的天、小时和分钟的列?我尝试了以下方法:
tweet_words$text <- tweet_words %>%
select(text) %>%
unnest_tokens(word, text)
原始数据框有一个文本列“tweet_words$text”,其中每行是 1 条推文。我尝试将文本列重写为单个单词的列,但由于日、小时、分钟列的行数不同,因此出现以下错误。我收到以下错误。
$<-.data.frame(*tmp*, text, value = list(word = c("same", :
替换有4571行,数据有300
任何想法如何促进预期的结果?
【问题讨论】:
-
请使用
dput添加数据并显示相同的预期输出。请阅读有关how to ask a good question 的信息以及如何提供reproducible example。 -
只需使用
tweet_words <- tweet_words %>% unnest_tokens(word, text),如果您还想获得全文,请在unnest_tokens中使用drop = FALSE。
标签: r tokenize data-cleaning unnest