【发布时间】:2023-02-01 06:12:32
【问题描述】:
我正在使用 Google 的训练模型文档人工智能.训练失败并出现以下错误(为简单起见,我只包含了 JSON 文件的一部分,但错误对于我的数据集中的所有文档都是相同的):
"trainingDatasetValidation": {
"documentErrors": [
{
"code": 3,
"message": "Invalid document.",
"details": [
{
"@type": "type.googleapis.com/google.rpc.ErrorInfo",
"reason": "INVALID_DOCUMENT",
"domain": "documentai.googleapis.com",
"metadata": {
"num_fields": "0",
"num_fields_needed": "1",
"document": "5e88c5e4cc05ddb8.json",
"annotation_name": "INCOME_ADJUSTMENTS",
"field_name": "entities.text_anchor.text_segments"
}
}
]
}
我从这个错误中了解到,该模型期望字段 INCOME_ADJUSTMENTS 在文档中(至少)出现一次,但它却找到了它的零个实例。
这是可以理解的,除非我已经在我的模式中将字段 INCOME_ADJUSTMENTS 定义为“可选一次”,即该字段可以出现零次或一次。
我错过了什么吗?尽管在架构中解决了这个错误,但为什么它仍然存在?
附:我也尝试过“可选多次”(以及“需要一次”和“需要多次”),但错误仍然存在。
编辑:根据要求,here's what one of the JSON files looks like。请注意,此处没有 PII,因为详细信息(姓名、SSN 等)是合成数据。
【问题讨论】:
-
没错,这没有意义,因为该字段不需要出现在设置了
OPTIONAL_ONCE的文档中。您能否共享导致此问题的特定 Document.json 文件? (已编辑任何 PII) -
@HoltSkinner 谢谢。我编辑了原始帖子以包含指向其中一个 JSON 文件的链接。
-
谢谢,与产品团队成员一起查看以进行调查
-
好的,关于这个的进一步问题。看起来错误是因为 INCOME_ADJUSTMENTS 字段的 Document.json 中未填充字段
Entity.textAnchor.textSegments。我不确定为什么它没有填充,大多数其他字段都已填充。 INCOME_ADJUSTMENTS 应该是什么类型的数据?是纯文本、金钱、复选框等吗?您是如何创建这些 Document.json 文件的?它是在 Workbench 标记工具、Human in the Loop 还是其他工具中? -
@HoltSkinner 与 OP 相同的问题,文档上传到工作台,使用在线工具进行标记,主要是由于文档格式不规则而避免使用文本选择工具。第一次看到错误后,将一些“required once”编辑为“optional once”并保存。使用架构编辑器后,它警告说它将应用于现有文档,但似乎并没有这样做。
标签: google-cloud-platform cloud-document-ai