【发布时间】:2020-07-14 23:06:28
【问题描述】:
我正在处理一个混乱的人口普查数据集,其中variable 列(high school 和university)中有重复项,但这些重复项实际上测量的结果略有不同。 count 列中数字较高的度量是 15 岁及以上 (highest_educ_15_over) 的总数。较低的数字始终是 24-65 岁的最高教育 (highest_educ_24_65)。这是视觉对象的数据。
data <- tribble(
~town, ~variable, ~count,
"A","highest_educ_15_over",100,
"A","high school",80,
"A","university",20,
"A","highest_educ_24_65",50,
"A","high school",40,
"A","university", 10,
"B","highest_educ_15_over",1000,
"B","high school", 800,
"B", "university", 200,
"B", "highest_educ_24_65", 500,
"B", "high school", 400,
"B", "university", 100)
我不能简单地过滤高中或大学,因为它会返回两个值。最终我不希望数据集看起来像这样:
tribble(
~town, ~highest_educ_15_over, ~highschool, ~university,
"A", "100","80","20",
"B", "1000","800","200"
)
我自动为每个城镇和相应的总分母取 high school 和 university 的最高值。
关于如何解决这个问题的任何想法?
【问题讨论】:
-
你能澄清一下你的预期输出是什么吗? “最终我不希望数据集看起来像这样”并不清楚。另外,您打算如何计算“总分母”?
标签: r dplyr tidyr data-cleaning