【发布时间】:2017-03-30 14:05:12
【问题描述】:
我正在尝试将 NLP 应用于 OCR 文档。要提取命名实体,如何使用文档中单词的位置等特征?
例如,我有一份健康报告,我需要提取报告中特定区域的化学术语,并避免它们在其他地方出现。我可以根据{top:x , left:y} 值为此定义一个位置特征吗?
有没有 sklearn 库?
【问题讨论】:
标签: python machine-learning nlp ocr
我正在尝试将 NLP 应用于 OCR 文档。要提取命名实体,如何使用文档中单词的位置等特征?
例如,我有一份健康报告,我需要提取报告中特定区域的化学术语,并避免它们在其他地方出现。我可以根据{top:x , left:y} 值为此定义一个位置特征吗?
有没有 sklearn 库?
【问题讨论】:
标签: python machine-learning nlp ocr
您可以构建提取区域来获取此内容。 换句话说,将图像中给定区域内具有所需内容的文档分组,然后从该区域获取所有图像的内容。
【讨论】: