【发布时间】:2017-10-10 12:19:27
【问题描述】:
我有一个数据框,其中有几个人作为列,SNP 作为行。每列都有一个等位基因(例如 G 或 A 或 N(如果未调用)。还有每个 SNP 的主要和(单独的列)次要等位基因列。我正在尝试将单个等位基因值转换为双等位基因值对于基于主要和次要等位基因列的每个值(因此,如果个人的等位基因是主要等位基因,我想用空格分隔符粘贴次要等位基因,反之亦然)。如果缺少值(N)我想用 0 0 替换它。这里的想法是为 Plink 格式化这些数据。
到目前为止,我已经尝试使用 ifelse 函数,但没有成功。关于如何在这里获得双等位基因值的任何建议?非常感谢你!我已经以我所指的格式包含了一个组成的数据集。
我现在拥有的:
rs# major minor ind1 ind2 ind3 ind4
rs123456 A G A A A G
rs123457 G C C G C G
rs123458 C G C C G C
rs123459 T A A T N T
我想要什么
rs major minor ind1 ind2 ind3 ind4
rs123456 A G A G A G A G G A
rs123457 G C C G G C C G G C
rs123458 C A C A C A A C C A
rs123459 T A A T T A 0 0 T A
谢谢! 抢
【问题讨论】:
-
为什么一定要依赖minor/major?核苷酸总是有其补体嘌呤/嘧啶(不包括 RNA)。生成它并将其粘贴到一个字符串中应该是一件轻而易举的事。
-
谢谢!我的例子做得不好,但在这种情况下,由于这些是单核苷酸多态性,它们不一定遵循互补核苷酸规则,例如复制。我可以对其进行编辑以使其更清晰。
-
请展示您期望的最复杂的示例。
-
嗨 Roman,实际上,我想我可以像以前那样处理单个等位基因。很抱歉浪费您的时间!
标签: r