【问题标题】:NER - Should I include common prefixes in labeled entitiesNER - 我应该在标记的实体中包含公共前缀吗
【发布时间】:2020-12-03 20:58:48
【问题描述】:

我正在尝试从文档图像中识别一组 OCR 文本中的实体。由于文本在文档中通常采用 some_label: value 形式,因此它也经常(但不总是)出现在 OCR 文本中。

我的问题是,假设我试图在我的 OCR 文本文件中注释日期,并且 80%​​ 的日期格式为 Date: xx/xx/xxxx;如果我……会更好吗?

  1. 仅将xx/xx/xxxx标记为我的日期实体
    • 代表真正的实体
    • 将代表 100% 的数据
  2. OR 将整个 Date: xx/xx/xxxx 标记为我的日期实体
    • 会利用常见的Date: 前缀来提高准确性吗?

另一个例子:

金额通常表示为$xxxxxx5.37$ 63.75

  1. 选择5.3763.75
  2. 选择$xxxxxx5.37$ 63.75(利用$ 符号)

其中哪一个是遵循/引导更好模型的更好做法?

(P.S.:我正在使用 Prodigy 来注释我的数据)

【问题讨论】:

    标签: spacy named-entity-recognition


    【解决方案1】:

    这取决于您使用的神经网络架构。

    假设您使用 spaCy v2 及其默认的神经架构,即 CNN。 在这种情况下,体系结构将根据特定窗口(即date 实体之前的 x 个单词和date 实体之后的 x 个单词)滑动浏览您的文本。

    使用这种方法,每当标记 Date: 出现在文本中时,神经网络很可能会识别出实体 date 就在它旁边。

    在这种情况下,我的建议是仅将 xx/xx/xxxx 日期的注释作为一个实体包含在内。这将使模型在确定日期entity 时具有更大的灵活性。但是,测试始终是找出最佳方法的最佳方法。所以,试一试吧:)

    【讨论】:

      猜你喜欢
      • 2020-11-25
      • 1970-01-01
      • 1970-01-01
      • 2011-12-19
      • 2020-06-08
      • 2019-11-24
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多