【问题标题】:How do I match a pattern and then copy multiple lines?如何匹配模式然后复制多行?
【发布时间】:2020-12-04 15:52:31
【问题描述】:

我正在处理两个文件。第一个文件是我必须搜索的主数据库文件。第二个文件是我可以制作的文件,它允许我命名我想从主数据库中提取的项目。我设法制作了一个 AWK 解决方案,它将搜索主数据库并提取与第二个文件匹配的确切行。但是,我不知道如何将匹配后的行复制到我的新文件中。

主数据库如下所示:

40005X/50005/60005/3/10/9/  
10038A/20038/30038/0/5/23./XXXX/
10039A/20039/30039/0/5/23./XXXX/
10040A/20040/30040/0/5/23./XXXX/
10041A/20041/30041/0/5/23./XXXX/
10042A/20042/30042/0/5/23./XXXX/
10043A/20043/30043/0/5/23./XXXX/
10044A/20044/30044/0/5/23./XXXX/
10045A/20045/30045/0/5/23./XXXX/
10046A/20046/30046/0/5/23./XXXX/
40006X/50006/60006/3/10/3/
10047A/20047/30047/0/5/23./XXXX/
10048A/20048/30048/0/5/23./XXXX/
10049A/20049/30049/0/5/23./XXXX/
40007X/50007/60007/3/10/3/
10050A/20050/30050/0/5/23./XXXX/
10051A/20051/30051/0/5/23./XXXX/
10052A/20052/30052/0/5/23./XXXX/
40008X/50008/60008/3/10/1/
10053A/20053/30053/0/5/23./XXXX/
40009X/50009/60009/3/10/3/
10054A/20054/30054/0/5/23./XXXX/
10055A/20055/30055/0/5/23./XXXX/
10056A/20056/30056/0/5/23./XXXX/
40010X/50010/60010/3/10/3/
10057A/20057/30057/0/5/23./XXXX/
10058A/20058/30058/0/5/23./XXXX/
10059A/20059/30059/0/5/23./XXXX/

在我的示例中,以 4000 开头的行是我匹配的第一行。该行中的最后一个数字告诉我要复制多少行。所以在第一行,40005X/50005/60005/3/10/9/,我将匹配 40005X,那行中的 9 告诉我下面有 9 行需要复制。

第二个文件很简单,看起来像这样:

40005X
40007X
40008X

当脚本找到每个匹配项时,我想将信息从第一个文件移动到一个新文件中进行分析。最终结果如下所示:

40005X/50005/60005/3/10/9/
10038A/20038/30038/0/5/23./XXXX/
10039A/20039/30039/0/5/23./XXXX/
10040A/20040/30040/0/5/23./XXXX/
10041A/20041/30041/0/5/23./XXXX/
10042A/20042/30042/0/5/23./XXXX/
10043A/20043/30043/0/5/23./XXXX/
10044A/20044/30044/0/5/23./XXXX/
10045A/20045/30045/0/5/23./XXXX/
10046A/20046/30046/0/5/23./XXXX/
40007X/50007/60007/3/10/3/
10050A/20050/30050/0/5/23./XXXX/
10051A/20051/30051/0/5/23./XXXX/
10052A/20052/30052/0/5/23./XXXX/
40008X/50008/60008/3/10/1/
10053A/20053/30053/0/5/23./XXXX/

我目前拥有的与第一行匹配的代码是这样的:

#! /bin/ksh

file1=input_file
file2=input_masterdb
file3=output_test

awk -F'/' 'NR==FNR {id[$1]; next} $1 in id' $file1 $file2 > $file3

我在 AWK 方面取得了最大的成功,但我愿意接受任何建议。但是,我正在 UNIX 系统上进行这项工作。我想将其保留为 KSH 脚本,因为我使用的大多数其他脚本都是以这种格式编写的,而且我最熟悉它。

感谢您的帮助!!

【问题讨论】:

    标签: awk ksh


    【解决方案1】:

    您现有的awk 与 ids 文件中的行正确匹配,您现在需要添加一个条件以在读取匹配行的最后一个字段后提前打印 N 行。因此,我们将变量p 设置为要打印的行数加一(当前行),然后每行打印减少。

    awk -F'/' 'NR==FNR{id[$0]; next} $1 in id{p=$6+1} p-->0{print}' file1 file2
    

    或与最后一个条件相同(由 Ed Morton 撰写)并涵盖任何可能的大文件极端情况

    awk -F'/' 'NR==FNR{id[$0]; next} $1 in id{p=$6+1} p&&p--' file1 file2
    

    这里省略了print 条件,因为它是默认操作,只要减少p 为正,条件再次为真。

    【讨论】:

      【解决方案2】:

      另一个

      $ awk -F/ 'NR==FNR       {a[$1]; next} 
                 !n && $1 in a {n=$(NF-1)+1} 
                 n&&n--' file2 file1
      
      40005X/50005/60005/3/10/9/
      10038A/20038/30038/0/5/23./XXXX/
      10039A/20039/30039/0/5/23./XXXX/
      10040A/20040/30040/0/5/23./XXXX/
      10041A/20041/30041/0/5/23./XXXX/
      10042A/20042/30042/0/5/23./XXXX/
      10043A/20043/30043/0/5/23./XXXX/
      10044A/20044/30044/0/5/23./XXXX/
      10045A/20045/30045/0/5/23./XXXX/
      10046A/20046/30046/0/5/23./XXXX/
      40007X/50007/60007/3/10/3/
      10050A/20050/30050/0/5/23./XXXX/
      10051A/20051/30051/0/5/23./XXXX/
      10052A/20052/30052/0/5/23./XXXX/
      40008X/50008/60008/3/10/1/
      10053A/20053/30053/0/5/23./XXXX/
      

      这会注意是否有任何内容行与给定的 id 匹配。这只会在指定的打印行数之后寻找另一个 id。

      【讨论】:

        【解决方案3】:

        您能否尝试在 GNU awk 中使用所示示例进行跟踪、编写和测试。考虑到您想从此处从数字 X 开始的行中打印行。根据 OP 的问题,Input_file2 是只有 id 的文件,而 Input_file1 是主文件。

        awk '
        {
          sub(/ +$/,"")
        }
        FNR==NR{
          a[$0]
          next
        }
        /^[0-9]+X/{
          match($0,/[0-9]+\/$/)
          no_of_lines_to_print=substr($0,RSTART,RLENGTH-1)
          found=count=""
        }
        {
          if(count==no_of_lines_to_print){  count=found=""  }
          for(i in a){
            if(match($0,i)){
              found=1
              print
              next
            }
          }
        }
        found{
          ++count
        }
        count<=no_of_lines_to_print && count!=""
        ' Input_file2  Input_file1
        

        【讨论】:

          猜你喜欢
          • 1970-01-01
          • 2022-01-13
          • 1970-01-01
          • 1970-01-01
          • 2010-11-26
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          相关资源
          最近更新 更多