【问题标题】:Google Document AI training fails due to an error that is already addressed由于已解决的错误,Google Document AI 训练失败
【发布时间】:2023-02-01 06:12:32
【问题描述】:

我正在使用 Google 的训练模型文档人工智能.训练失败并出现以下错误(为简单起见,我只包含了 JSON 文件的一部分,但错误对于我的数据集中的所有文档都是相同的):

"trainingDatasetValidation": {
      "documentErrors": [
        {
          "code": 3,
          "message": "Invalid document.",
          "details": [
            {
              "@type": "type.googleapis.com/google.rpc.ErrorInfo",
              "reason": "INVALID_DOCUMENT",
              "domain": "documentai.googleapis.com",
              "metadata": {
                "num_fields": "0",
                "num_fields_needed": "1",
                "document": "5e88c5e4cc05ddb8.json",
                "annotation_name": "INCOME_ADJUSTMENTS",
                "field_name": "entities.text_anchor.text_segments"
              }
            }
          ]
        }

我从这个错误中了解到,该模型期望字段 INCOME_ADJUSTMENTS 在文档中(至少)出现一次,但它却找到了它的零个实例。

这是可以理解的,除非我已经在我的模式中将字段 INCOME_ADJUSTMENTS 定义为“可选一次”,即该字段可以出现零次或一次。

我错过了什么吗?尽管在架构中解决了这个错误,但为什么它仍然存在?

附:我也尝试过“可选多次”(以及“需要一次”和“需要多次”),但错误仍然存​​在。

编辑:根据要求,here's what one of the JSON files looks like。请注意,此处没有 PII,因为详细信息(姓名、SSN 等)是合成数据。

【问题讨论】:

  • 没错,这没有意义,因为该字段不需要出现在设置了 OPTIONAL_ONCE 的文档中。您能否共享导致此问题的特定 Document.json 文件? (已编辑任何 PII)
  • @HoltSkinner 谢谢。我编辑了原始帖子以包含指向其中一个 JSON 文件的链接。
  • 谢谢,与产品团队成员一起查看以进行调查
  • 好的,关于这个的进一步问题。看起来错误是因为 INCOME_ADJUSTMENTS 字段的 Document.json 中未填充字段 Entity.textAnchor.textSegments。我不确定为什么它没有填充,大多数其他字段都已填充。 INCOME_ADJUSTMENTS 应该是什么类型的数据?是纯文本、金钱、复选框等吗?您是如何创建这些 Document.json 文件的?它是在 Workbench 标记工具、Human in the Loop 还是其他工具中?
  • @HoltSkinner 与 OP 相同的问题,文档上传到工作台,使用在线工具进行标记,主要是由于文档格式不规则而避免使用文本选择工具。第一次看到错误后,将一些“required once”编辑为“optional once”并保存。使用架构编辑器后,它警告说它将应用于现有文档,但似乎并没有这样做。

标签: google-cloud-platform cloud-document-ai


【解决方案1】:

我过去和你有过同样的问题,现在也有。

我设法做的是从错误消息中获取文档字符串,然后在具有数据集的存储桶中搜索图像。

然后我打开图像并在我的 1000 多张图像数据集中搜索该图像。

然后我删除了有问题的标签的边界框,然后重新标记了它。这似乎解决了我遇到的 90% 的问题。

这是大量的手动工作,我希望谷歌在发布 Doc AI 的 Web 应用程序时能想到更多,因为 ML 部分很棒,但该应用程序确实乏善可陈。

我也很高兴有任何其他修复

【讨论】:

    【解决方案2】:

    我有同样的问题。 所以我删除了所有数据集并再次导入并重新标记。 然后训练效果很好。

    【讨论】:

    • 从头开始重新导入和重新标记不可能被视为修复。如果我已经手动标记了数百/数千个文档怎么办?这是工作的日子。
    • 是的,在我的例子中,数据集是 20。所以我可以做到,但如果是成百上千,最好找到另一种方法。
    • 您的答案可以通过其他支持信息得到改进。请edit 添加更多详细信息,例如引用或文档,以便其他人可以确认您的答案是正确的。你可以找到更多关于如何写出好的答案的信息in the help center
    猜你喜欢
    • 2016-06-25
    • 1970-01-01
    • 2019-01-05
    • 2020-02-27
    • 2020-06-19
    • 1970-01-01
    • 1970-01-01
    • 2015-09-02
    • 1970-01-01
    相关资源
    最近更新 更多