【发布时间】:2017-05-22 15:52:09
【问题描述】:
我有一个 .txt 文件中的样本列表。每个样本都有多行,它们是来自该样本的观察值。列显示开始和结束位置。我想计算每个样本的相同观察对的数量。
sample start end
sampleA D C
sampleA D D
sampleB A A
sampleA D D
sampleB A A
sampleB B A
sampleB B A
sampleA A A
预期输出(其中第 1 列和第 2 列是成对的观察值,第 3 列是该观察值的计数:
sampleA
D D 2
D C 1
A A 1
sampleB
A A 2
B A 2
我知道如何使用 count() 和arrange(desc()) 来为单个观察执行此操作,但是当我需要同时考虑两列时您如何操作?
提前致谢。
【问题讨论】:
-
count(yourdata, sample, start, end)适合你吗?