【发布时间】:2015-04-09 14:42:42
【问题描述】:
在讨论如何在 R 中组织工作流和项目时,通常建议使用package be written 来记录和共享工作。我想知道:是否有使用 R 包发布和公开可用数据的优先级(以及相关材料,如元数据、自定义数据处理工具等),通过 CRAN 或某些其他出口?我处理需要多个清理阶段的数据,例如基本消除错别字、基本记录匹配和缺失数据的自定义插补,然后是各种形式的重塑和聚合以进行特定分析。 R 包似乎是记录和呈现用于生成的数据和方法的有用方法。主要缺点是时间投入。好处似乎很多:为我们实验室的未来学生、我未来的自己和其他潜在用户提供高标准的文档、完全可重复性以及随着收集更多数据而更新数据的平台。
一些背景:通过期刊托管的在线附录将数据发布为平面文件+元数据在我的领域中越来越普遍; third-party website 也很受欢迎。数据和分析的复制通常是可能的,但数据有时会被高度“按摩”,处理过程中的步骤并不总是可以复制,有时会限制进行替代分析的能力。我的顾问和我想发布一项为期 15 年的纵向研究的第一个 10 年的数据。我已经需要清理我的数据处理脚本以传递给未来的学生/合著者,仅此一项就可能使内部使用的包变得有用。
【问题讨论】:
-
Bioconductor 项目一直使用包来发布数据。
标签: r package data-cleaning