【发布时间】:2015-09-11 03:48:45
【问题描述】:
我有一个超过 800 万行和 8 列的制表符分隔文件;像这样:
contig17_11 T C 0.05 TACTACTTGTGGACGAT TTTTGGCACCCTACGATTAATT TTTTT CNCCN
contig10_97 G A 0.05 GCTCCTGTCGGAAAATAACCCGA GGGGTGTTGATTGTTTTCTT GGGGG NNANA
contig10_10 G A 0.05 GCAAGAGATAGAGCATCGCTC GGATCCCCAGGACCTGAGAC GGGGG AAAAN
我需要在第 7 列提取第 4 个字符(DNA 碱基)为 A 或 C 或 G 或 T 的行,在第 8 列第 4 个字符为“N”。第 7 列和第 8 列的长度均为 5 个字母。我尝试了基本的 awk grep 命令来执行此操作,但没有结果。我试过猫输入文件| awk '$8 ~ /N/' >outfile 练习,有点不是我要找的。p>
【问题讨论】:
-
能否将示例数据的格式更清晰一些,让换行符很明显?
-
我不知道怎么做,谢谢 Fredrik