【发布时间】:2021-02-06 16:39:37
【问题描述】:
我有一个包含以下标题(以 > 开头的行)的参考基因组,我想将其重命名为染色体的数字/字母。我想要一个 sed 语句来做这个系统的替换,但我是 sed 的新手。文件的其他地方是额外的头文件,应该保持不变,并且头文件之间的基因序列应该保持不变。
>ST078050.1 Ovis aries is a sheep chromosome 1, whole genome shotgun sequence
>ST078051.1 Ovis aries is a sheep chromosome 2, whole genome shotgun sequence
>ST078052.1 Ovis aries is a sheep chromosome 3, whole genome shotgun sequence
>ST078053.1 Ovis aries is a sheep chromosome 4, whole genome shotgun sequence
>ST078054.1 Ovis aries is a sheep chromosome 5, whole genome shotgun sequence
>ST078055.1 Ovis aries is a sheep chromosome 6, whole genome shotgun sequence
>ST078056.1 Ovis aries is a sheep chromosome 7, whole genome shotgun sequence
>ST078057.1 Ovis aries is a sheep chromosome 8, whole genome shotgun sequence
>ST078058.1 Ovis aries is a sheep chromosome 9, whole genome shotgun sequence
>ST078059.1 Ovis aries is a sheep chromosome 10, whole genome shotgun sequence
>ST078079.1 Ovis aries is a sheep chromosome X, whole genome shotgun sequence
>ST078080.1 Ovis aries is a sheep chromosome Y, whole genome shotgun sequence
输出应该是:
>1
>2
>3
>4
>5
>6
>7
>8
>9
>10
>X
>Y
我尝试了以下,但它不正确。
sed 's/^.*\(chromosome.*,\).*$/\1/' file
谢谢!
【问题讨论】:
-
这可能会有所帮助:
awk '{print ">" substr($1, 1, length($1)-1)}' FPAT='[^ ]+,' file -
那么,
>是文件内容的一部分吗?我have updated my answer.