【问题标题】:How to extract the keyword properties of a PDF URL using IBM Watson Explorer?如何使用 IBM Watson Explorer 提取 PDF URL 的关键字属性?
【发布时间】:2017-07-14 16:47:45
【问题描述】:
【问题讨论】:
标签:
pdf
keyword
ibm-watson
extraction
【解决方案1】:
我不知道开箱即用的方式,但您可以尝试实现爬虫插件或您自己的爬虫。有一些钩子可以添加提取元数据并将它们添加到索引中,例如在爬虫插件中你可以做这样的事情
@Override
public CrawledData updateDocument(CrawledData crawledData) throws CrawlerPluginException {
List<FieldMetadata> metadataList = crawledData.getMetadataList();
String MyPDFProperty= getFromOriginalContent(crawledData.getOriginalContents());
//getFromOriginalContent method you need to implement for your PDF document
if (metadataList == null) {
metadataList = new ArrayList<FieldMetadata>();
}
FieldMetadata pdfFieldMetaData = new FieldMetadata("pdfextractedpropertyr", MyPDFProperty);
metadataList.add(pdfFieldMetaData);
crawledData.setMetadataList(metadataList);
} catch (ClientServicesException e) {
logger.error(e.getMessage());
throw new CrawlerPluginException(e);
}
}
return crawledData;
}