【问题标题】:replacing a specific column with a specific value using gawk使用 gawk 用特定值替换特定列
【发布时间】:2012-04-03 01:27:33
【问题描述】:

我试图在任何地方找到我的数据在第 2 列中有 90 并且上面的两行更改第 2 列的值。例如在下面的数据中,如果我在第 11 行看到 90,我想更改我的第 2 列值在第 9 行,从 11 到 5。我有一组预定的值,我想将数字更改为;值将始终分别为 10,11,12,30,31,32 到 1,2,3,4,5,6。

我的数据

 #      Type    Response        Acc     RT      Offset    
   1      70  0    0   0.0000 57850
   2      31  0    0   0.0000 59371
   3      41  0    0   0.0000 60909
   4      70  0    0   0.0000 61478
   5      31  0    0   0.0000 62999 
   6      41  0    0   0.0000 64537
   8      70  0    0   0.0000 65106
   9      11  0    0   0.0000 66627
  10      21  0    0   0.0000 68165
  11      90  0    0   0.0000 68700
  12      31  0    0   0.0000 70221

我想要什么

 #      Type    Response        Acc     RT      Offset    
   1      70  0    0   0.0000 57850
   2      31  0    0   0.0000 59371
   3      41  0    0   0.0000 60909
   4      70  0    0   0.0000 61478
   5      31  0    0   0.0000 62999 
   6      41  0    0   0.0000 64537
   8      70  0    0   0.0000 65106
   9       5  0    0   0.0000 66627
  10      21  0    0   0.0000 68165
  11      90  0    0   0.0000 68700
  12      31  0    0   0.0000 70221

我一直在尝试存储上一行并将其用作参考,但我只能返回一行,我需要返回两行。感谢您的帮助。

【问题讨论】:

  • 您的翻译序列10,11,12,30,31,321,2,3,4,5,6 与您将11 更改为5 的要求不一致

标签: replace awk gawk


【解决方案1】:

这应该可行:

function pra(a) {
  for(e in a) {
    printf "%s ", a[e];
  }
  print ""; 
}
BEGIN {
  vals[10] = 1;
  vals[11] = 2;
  vals[12] = 3;
  vals[30] = 4;
  vals[31] = 5;
  vals[32] = 6;
}
NR == 1 { split($0, a, " ") }
NR == 2 { split($0, b, " ") }
NR > 2 { 
  if($2 == "90") {
    a[2] = vals[a[2]];
  }
  pra(a);
  al = 0;
  for(i in a) al++;
  for(i = 1; i <= al; i++) {
    a[i] = b[i];
  }
  split($0, b, " ");
}
END {
  pra(a);
  pra(b);
}

其工作原理的概要: * BEGING 块 - 将翻译值分配给vals * NR == 1 和 NR == 2 - 记住前两行拆分为数组 ab * NR > 2 - 前两行之后的所有行 * 如果第二列的值为90,则使用翻译数组进行更改 * 将数组b的元素移动到a,并将当前行拆分为b * END 块 - 打印ab,基本上是最后两行

示例运行:

$ cat inp && awk -f mkt.awk inp 
 #      Type    Response        Acc     RT      Offset    
   1      70  0    0   0.0000 57850
   2      31  0    0   0.0000 59371
   3      41  0    0   0.0000 60909
   4      70  0    0   0.0000 61478
   5      31  0    0   0.0000 62999 
   6      41  0    0   0.0000 64537
   8      70  0    0   0.0000 65106
   9      11  0    0   0.0000 66627
  10      21  0    0   0.0000 68165
  11      90  0    0   0.0000 68700
  12      31  0    0   0.0000 70221

# Type Response Acc RT Offset 
1 70 0 0 0.0000 57850 
2 31 0 0 0.0000 59371 
3 41 0 0 0.0000 60909 
4 70 0 0 0.0000 61478 
5 31 0 0 0.0000 62999 
6 41 0 0 0.0000 64537 
8 70 0 0 0.0000 65106 
9 2 0 0 0.0000 66627 
10 21 0 0 0.0000 68165 
11 90 0 0 0.0000 68700 
12 31 0 0 0.0000 70221 

你可以这样做:

function pra(a) {
  printf "%4d%8d%3d%5d%9.4f%6d\n", a[1], a[2], a[3], a[4], a[5], a[6]
}
BEGIN {
  vals[10] = 1;
  vals[11] = 2;
  vals[12] = 3;
  vals[30] = 4;
  vals[31] = 5;
  vals[32] = 6;
}
NR == 1 { print }
NR == 2 { split($0, a, " ") }
NR == 3 { split($0, b, " ") }
NR > 4 {
  if($2 == "90") {
    a[2] = vals[a[2]];
  }
  pra(a);
  for(i = 1; i <= 6; i++) {
    a[i] = b[i];
  }
  split($0, b, " ");
}
END {
  pra(a);
  pra(b);
}

使其适用于包含格式的特定情况。示例运行:

$ cat inp && awk -f mkt.awk inp 
 #      Type    Response        Acc     RT      Offset    
   1      70  0    0   0.0000 57850
   2      31  0    0   0.0000 59371
   3      41  0    0   0.0000 60909
   4      70  0    0   0.0000 61478
   5      31  0    0   0.0000 62999 
   6      41  0    0   0.0000 64537
   8      70  0    0   0.0000 65106
   9      11  0    0   0.0000 66627
  10      21  0    0   0.0000 68165
  11      90  0    0   0.0000 68700
  12      31  0    0   0.0000 70221 
 #      Type    Response        Acc     RT      Offset    
   1      70  0    0   0.0000 57850
   2      31  0    0   0.0000 59371
   4      70  0    0   0.0000 61478
   5      31  0    0   0.0000 62999
   6      41  0    0   0.0000 64537
   8      70  0    0   0.0000 65106
   9       2  0    0   0.0000 66627
  10      21  0    0   0.0000 68165
  11      90  0    0   0.0000 68700
  12      31  0    0   0.0000 70221

【讨论】:

  • 哇,谢谢你这么快回复。我试过你的代码,是否可以保持我上面显示的数据格式?当我运行您的代码时,它给了我一个输出,其中数据和标题重新排列(Acc RT Offset # Type Response 0 0.0000 43991 1 55 0)。另外,是否可以给我一个代码如何运行的细分?另外,非常感谢,它在很大程度上确实有效。
  • 谢谢 - 看到编辑,希望能给你一些工作。
  • 注意:当有问题的字段在列表10,11,12,30,31,32not 时,它会造成错误的替换......它用0 替换那里的任何数字...... . 他提到给定的列表有明确的替代品,但我不确定他是否意味着该列表包含唯一可能的值......(如果可以有其他值,值得一提)。
  • 非常感谢,第二个代码可以让我保持格式。我的值都是 10,11,12,30,31,32,所以这部分没有问题,但感谢您的关注,我将在未来寻找它们。还要感谢您提供的非常有帮助的细分。
【解决方案2】:

此版本保留您的原始格式

awk 'BEGIN{ new[" 1"]="10"; new[" 2"]="11"; new[" 3"]="12"
            new[" 4"]="30"; new[" 5"]="31"; new[" 6"]="32" }
     { line[-2]=line[-1]; line[-1]=line[0]; line[0]=$0 } 
     $2==90 { if( match( line[-2], /^ *[0-9]+ +[1-6] / ) ) { 
                  old=substr( line[-2], RLENGTH-2,2 )
                  line[-2]=substr( line[-2], 1, RLENGTH-3 ) new[old] \
                           substr( line[-2], RLENGTH ) } }
     NR>2 { printf("%s\n",line[-2]) } 
     END { printf("%s\n%s\n",line[-1],line[0]) }' file.in

【讨论】:

    猜你喜欢
    • 2012-03-31
    • 1970-01-01
    • 1970-01-01
    • 2021-07-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-12-22
    • 2020-10-19
    相关资源
    最近更新 更多