【发布时间】:2015-07-28 10:15:41
【问题描述】:
我想连接所有相似度得分超过0.955 的行。 Abo 和 Bel 列分别代表上下行的相似度得分。在以下输入 df 我有 10 个基因组探针(NAME 列),它们仅连接在 4 个基因组片段中(dfout)。
df <- " NAME Abo Bel Chr GD Position
BovineHD0100009217 NA 1.0000000 1 0 31691781
BovineHD0100009218 1.0000000 0.6185430 1 0 31695808
BovineHD0100019600 0.6185430 0.9973510 1 0 69211537
BovineHD0100019601 0.9973510 1.0000000 1 0 69213650
BovineHD0100019602 1.0000000 1.0000000 1 0 69214650
BovineHD0100019603 1.0000000 0.6600000 1 0 69217942
BovineHD0100047112 0.6600000 1.0000000 1 0 93797691
BovineHD0100026604 1.0000000 1.0000000 1 0 93815774
BovineHD0100026605 1.0000000 0.4649007 1 0 93819471
BovineHD0100029861 0.4649007 NA 1 0 105042452"
df <- read.table(text=df, header=T)
我的预期输出dfout:
dfout <- "Chr start end startp endp nprob
1 31691781 31695808 BovineHD0100009217 BovineHD0100009218 2
1 69211537 69217942 BovineHD0100019600 BovineHD0100019603 4
1 93797691 93819471 BovineHD0100047112 BovineHD0100026605 3
1 105042452 105042452 BovineHD0100029861 BovineHD0100029861 1"
dfout <- read.table(text=dfout, header=T)
有什么想法吗?
【问题讨论】:
-
附带问题,您使用什么函数来获取探针的相似度分数?
-
给定种群中给定动物的后续探针之间的基因型相似性。推断具有非常相似基因型分布的探针的基因组片段(CNV 等位基因)的方法。
标签: r concatenation bioinformatics bioconductor genome