您拥有的是 PDF 中的表格数据和信息以名称-值对形式出现的属性类型数据的组合。
有谁知道如何将文本和数据scraping一起使用并插入到 Excel 中?
您已经完成了第一部分。现在只需将新活动添加到您的流程或工作流中,这些活动将在提取表格数据后提取文本。将特定数据字段保存在变量中,然后只需使用 Excel 活动将 DataTable 和变量中保存的信息写入电子表格。 Append Range 和 Write Cell Excel 活动可能会起到作用。
表数据与名称-值对
UiPath data scraping 函数非常适合表格数据。正如您所发现的,它将所有内容都以DataTable 的形式返回。个别数据需要更细粒度的数据提取。
对于 104445,您需要将 get Text 函数与 Anchor Base 函数结合使用。
- 您将
Anchor Base 函数添加到页面上。 Anchor Base 需要添加两个活动才能使其工作。
- 第一个活动是
get Element。这将指定 104445 左侧的标签。
- 然后添加
get Textactivity 以检索get Element 活动旁边的文本。这将提取 104445。
- 然后您将结果保存在一个字符串变量中并根据需要使用它。
锚定基础活动示例
在下面的 UiPath Anchor Base 示例中,标签位于我要提取的文本上方,因此 Anchor Base 活动将锚位置设置为要提取的文本上方。在您的示例中,您将设置 UiPath Anchor Base 活动以指示锚点位于要提取的文本的左侧。
顺便说一句,您可以单独使用 PDF get Text 活动而不使用 Anchor Base 活动,但如果您需要从 multiple PDFs 中提取数据,它可能无法工作,因为 UiPath 选择器将过于具体.如果您需要循环浏览多个 PDF 文件,则需要使用 Anchor Base 活动。
仅标记的 PDF
只是给正在查看此答案的其他人的注释。为了使数据抓取和文本活动正常工作,必须标记 PDF。如果属性表明 PDF 未被标记,则这些功能将不会总是像宣传的那样工作。此外,如果 PDF 真的只是扫描图像,您将需要使用UiPath OCR 工具。数据抓取和获取文本活动根本不起作用。
此外,为了使数据抓取或文本活动正常工作,您需要更改 Adobe 或 FoxIt 阅读器的阅读顺序属性以进行推断或标记。