【问题标题】:Is there a precedence for publishing data via a package in R?通过 R 中的包发布数据是否有优先权?
【发布时间】:2015-04-09 14:42:42
【问题描述】:

在讨论如何在 R 中组织工作流和项目时,通常建议使用package be written 来记录和共享工作。我想知道:是否有使用 R 包发布和公开可用数据的优先级(以及相关材料,如元数据、自定义数据处理工具等),通过 CRAN 或某些其他出口?我处理需要多个清理阶段的数据,例如基本消除错别字、基本记录匹配和缺失数据的自定义插补,然后是各种形式的重塑和聚合以进行特定分析。 R 包似乎是记录和呈现用于生成的数据和方法的有用方法。主要缺点是时间投入。好处似乎很多:为我们实验室的未来学生、我未来的自己和其他潜在用户提供高标准的文档、完全可重复性以及随着收集更多数据而更新数据的平台。

一些背景:通过期刊托管的在线附录将数据发布为平面文件+元数据在我的领域中越来越普遍; third-party website 也很受欢迎。数据和分析的复制通常是可能的,但数据有时会被高度“按摩”,处理过程中的步骤并不总是可以复制,有时会限制进行替代分析的能力。我的顾问和我想发布一项为期 15 年的纵向研究的第一个 10 年的数据。我已经需要清理我的数据处理脚本以传递给未来的学生/合著者,仅此一项就可能使内部使用的包变得有用。

【问题讨论】:

  • Bioconductor 项目一直使用包来发布数据。

标签: r package data-cleaning


【解决方案1】:

BioConductor 经常这样做:参见this page about 'experiment data' packages

有趣的是,CRAN 有一些数据包,例如 EcDat

但总的来说,也许本地存档会更好?我碰巧把 a recent package 放到了 CRAN 上,它可以在那里提供帮助。

【讨论】:

    猜你喜欢
    • 2010-09-20
    • 2014-07-02
    • 1970-01-01
    • 1970-01-01
    • 2023-04-08
    • 1970-01-01
    • 1970-01-01
    • 2011-04-06
    • 2013-02-28
    相关资源
    最近更新 更多