【发布时间】:2021-04-26 22:50:39
【问题描述】:
我正在使用包含莎士比亚全部作品的数据集,其中数据框中的每一行都是莎士比亚文本的一行,并且我正在尝试将单独的文本行组合成每个剧本的一大行内容莎士比亚的。到目前为止,我已经能够使用 dplyr 中的 group_split 将数据帧拆分为包含每个作品内容的小标题,但我似乎无法根据剧名从小标题中提取内容。
到目前为止,我已经能够使用以下代码创建一个包含 tibbles 的大型向量列表:
playtbls <- data %>%
group_split(name)
我不知道如何在不重复使用索引格式的情况下从生成的小标题中访问任何内容。我已经能够使用以下代码提取单个小标题的内容,但我知道必须有一种更快更清洁的方法来做到这一点!
playtbls[[1]][["content"]]
我的最终目标是能够将这些 tibbles 的内容附加到一个新的数据框“plays”,其中包含每个戏剧的标题和流派,其中每个戏剧都是单独的行。基本上,我需要能够说出每个剧本的名称,当plays$name == playtbls[[x]][["name"]] 时,将playtbls[[x]][["content"]] 附加到播放数据帧
数据可从 bardr 包中获得。
【问题讨论】:
-
如果您创建一个小的可重现示例以及预期的输出,这将更容易提供帮助。阅读how to give a reproducible example。