【发布时间】:2021-09-28 23:43:12
【问题描述】:
好的,所以我有一个表格,它的前几行看起来有点像这样:
| Department | Diagnosis Code |
|---|---|
| Dept. 1 | Code1 |
| Dept. 2 | Code2 |
| Dept. 3 | Code3 |
| Dept. 3 | Code3 |
| Dept. 3 | Code4 |
| Dept. 4 | Code4 |
| Dept. 4 | Code4 |
| Dept. 4 | Code5 |
| Dept. 4 | Code5 |
| Dept. 4 | Code5 |
我想要的是开发一个如下所示的表格:
| Department | Code1% | Code2% | Code3% | Code4% | Code5% |
|---|---|---|---|---|---|
| Dept. 1 | xx% | xx% | xx% | xx% | xx% |
其中上述百分比是每个部门每个代码的百分比,即代码1在部门1中出现的总次数除以部门1中“代码实例”的出现总数。所以如果代码1在部门 1 中出现了 50 次,部门 1 在所有代码中记录了 120 个部门代码实例,百分比应该是 50/120。
我正在尝试使用 group_by()、mutate() 和 summarise() 的某种组合来完成工作,但我无法弄清楚如何正确组合和编写代码来获得我的输出想要。
当第二列是某种数字频率类型时,我已经看到很多示例代码显示类似的内容,但是当第二列包含与离散类别相对应的字符串时,我还没有找到相同的内容。
**编辑:此外,代码是字母数字。例如,一个代码可能类似于 E77.09,而另一个代码可能类似于 C30,另一个可能是 D24.3
【问题讨论】:
标签: r dplyr data-analysis tidyr exploratory-data-analysis