【问题标题】:How to extract the keyword properties of a PDF URL using IBM Watson Explorer?如何使用 IBM Watson Explorer 提取 PDF URL 的关键字属性?
【发布时间】:2017-07-14 16:47:45
【问题描述】:

我想从 PDF 链接中提取 PDF 的关键字值。我正在抓取一个页面,其中包含指向某些 PDF 的链接。我想构建一个虚拟文档,我必须将这些 PDF 排入队列。我不想抓取那些 PDF 的内容,但我只想从这些 PDF 中提取关键字。当我用检查源打开这些 PDF 链接时,它确实有一个关键字字段。但它没有关键字的任何值。它看起来像这样:

 <div class="row">
 <span data-l10n-id="document_properties_keywords">Keywords:</span> <p id="keywordsField">-</p>
 </div>

有没有办法从 PDF 中提取关键字?我看到那些 PDF 有关键字,当我下载这些 PDF 时,打开 PDF 属性和关键字有一些价值。

参考:https://www.ibm.com/support/knowledgecenter/SS8NLW_10.0.0/com.ibm.swg.im.infosphere.dataexpl.engine.tut.virt.doc/t_cc-build-virt-docs.html

【问题讨论】:

    标签: pdf keyword ibm-watson extraction


    【解决方案1】:

    我不知道开箱即用的方式,但您可以尝试实现爬虫插件或您自己的爬虫。有一些钩子可以添加提取元数据并将它们添加到索引中,例如在爬虫插件中你可以做这样的事情

    @Override
        public CrawledData updateDocument(CrawledData crawledData) throws CrawlerPluginException {
    
            List<FieldMetadata> metadataList = crawledData.getMetadataList();
            String MyPDFProperty= getFromOriginalContent(crawledData.getOriginalContents());
    //getFromOriginalContent method you need to implement for your PDF document
    
              if (metadataList == null) {
                 metadataList = new ArrayList<FieldMetadata>();
              }                       
    
    FieldMetadata pdfFieldMetaData = new FieldMetadata("pdfextractedpropertyr", MyPDFProperty);
                    metadataList.add(pdfFieldMetaData);
                    crawledData.setMetadataList(metadataList);
    
                } catch (ClientServicesException e) {
    
                    logger.error(e.getMessage());
                    throw new CrawlerPluginException(e);
                }
              }
              return crawledData;
        }
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2016-03-22
      • 2017-03-31
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-01-16
      • 1970-01-01
      相关资源
      最近更新 更多