【发布时间】:2020-12-03 20:58:48
【问题描述】:
我正在尝试从文档图像中识别一组 OCR 文本中的实体。由于文本在文档中通常采用 some_label: value 形式,因此它也经常(但不总是)出现在 OCR 文本中。
我的问题是,假设我试图在我的 OCR 文本文件中注释日期,并且 80% 的日期格式为 Date: xx/xx/xxxx;如果我……会更好吗?
- 仅将
xx/xx/xxxx标记为我的日期实体- 代表真正的实体
- 将代表 100% 的数据
-
OR 将整个
Date: xx/xx/xxxx标记为我的日期实体- 会利用常见的
Date:前缀来提高准确性吗?
- 会利用常见的
另一个例子:
金额通常表示为$xxxxxx5.37 和$ 63.75
- 选择
5.37和63.75 - 选择
$xxxxxx5.37和$ 63.75(利用$ 符号)
其中哪一个是遵循/引导更好模型的更好做法?
(P.S.:我正在使用 Prodigy 来注释我的数据)
【问题讨论】:
标签: spacy named-entity-recognition