【发布时间】:2021-09-19 21:39:29
【问题描述】:
数据显示某些点的 NA,但信息就在它的正下方。它是相同的 UPC、商店和周。如何对数据进行分组以避免冗余和 NA 数据?
这是我目前的代码:
`library(tidyverse)
RD <- read.csv("Raw Soft Drinks Sales Data.csv")
U <- read.csv("UPC Soft Drinks.csv") %>%
mutate(UPC = as.factor(UPC),
BRAND = as.factor(BRAND),
CLASS = as.factor(CLASS))
RDX <- RD %>%
filter(UPC != "Total") %>%
select (-c(Total.Q1,Total.Q2,Total.Q3,Total.Q4))
RDXL <- RDX %>%
pivot_longer(
cols = starts_with("Week"),
# cols = X1:X52,
# cols = !c("STORE","UPC"),
names_to = "WEEK",
names_prefix = "Week",
values_to = "UNITS",
values_drop_na = TRUE)
RDW <- pivot_wider(RDXL, names_from = "ITEM", values_from = "UNITS")%>%
select(-TOTAL)
`
这是原始数据集的样子: original data
我需要将 Store、UPC、Dollars、Units、Feat、Deal 和 Week 作为它们自己的列。
【问题讨论】:
-
请提供reproducible minimal example。特别是,以清晰且易于使用的格式提供一些样本和目标数据,例如使用
dput()并使用reprex-package。 -
看起来像一个相当简单的合并/加入过程:
merge(df[1:2] , df[c(1,3)])作为开始。merge是基础 R。在 tidyverse 中查找各种*_join函数的帮助页面和示例。 -
请注意r标签页顶部的说明,尤其是不要使用图像的说明,因为没有人可以在不重新输入的情况下轻松使用它们。
-
除了 G. Grothendieck 的评论,原因如下:meta.stackoverflow.com/a/285557/11374827
标签: r tidyverse data-wrangling tidy