【问题标题】:Cloud Vision API - PDF OCRCloud Vision API - PDF OCR
【发布时间】:2016-04-19 20:03:30
【问题描述】:

我刚刚测试了 Google Cloud Vision API 以读取图像中的文本(如果存在)。

到目前为止,我安装了 Maven 服务器和 Redis 服务器。我只是按照此页面中的说明进行操作。

https://github.com/GoogleCloudPlatform/cloud-vision/tree/master/java/text

到目前为止,我能够使用 .jpg 文件进行测试,是否可以使用 tiff 文件或 pdf 文件进行测试?

我正在使用以下命令:

java -cp target/text-1.0-SNAPSHOT-jar-with-dependencies.jar     com.google.cloud.vision.samples.text.TextApp ../../data/text/

在文本目录中,我有 jpg 格式的文件。

然后读取转换后的文件,我不知道怎么做,就运行下面的命令

java -cp target/text-1.0-SNAPSHOT-jar-with-dependencies.jar com.google.cloud.vision.samples.text.TextApp

然后我收到消息输入要在转换后的文件中搜索的单词或短语。有没有办法查看整个文档的转换?

谢谢!

【问题讨论】:

标签: google-cloud-vision


【解决方案1】:

2018 年 4 月 6 日,Google Cloud Vision API 添加了对PDF 和 TIFF 文件检测文档文本的支持(请参阅Release Notes)。

根据documentation

  • Vision API 可以检测和转录 PDF 和 TIFF 中的文本 存储在 Google Cloud Storage 中的文件

  • 必须使用 asyncBatchAnnotate 函数,它执行异步请求并使用操作资源提供其状态。

  • 输出来自 PDF/TIFF 请求写入指定 Google Cloud Storage 存储桶中创建的 JSON 文件


例子:

1) 将文件上传到您的 Google 云存储

2) 发出 POST 请求以执行 PDF/TIFF 文档文本检测

请求:

POST https://vision.googleapis.com/v1p2beta1/files:asyncBatchAnnotate
Authorization: Bearer <your access token>

{
  "requests":[
    {
      "inputConfig": {
        "gcsSource": {
          "uri": "gs://<your bucket name>/input.pdf"
        },
        "mimeType": "application/pdf"
      },
      "features": [
        {
          "type": "DOCUMENT_TEXT_DETECTION"
        }
      ],
      "outputConfig": {
        "gcsDestination": {
          "uri": "gs://<your bucket name>/output/"
        },
        "batchSize": 1
      }
    }
  ]
}

回复:

{
  "name": "operations/9b1f9d773d216406"
}

3) 发出 GET 请求以检查文档文本检测是否完成

请求:

GET https://vision.googleapis.com/v1/operations/9b1f9d773d216406
Authorization: Bearer <your access token>

回复:

{
    "name": "operations/9b1f9d773d216406",
    "metadata": {
        "@type": "type.googleapis.com/google.cloud.vision.v1p2beta1.OperationMetadata",
        "state": "RUNNING",
        "updateTime": "2018-06-17T20:18:09.117787733Z"
    },
    "done": true,
    "response": {
        "@type": "type.googleapis.com/google.cloud.vision.v1p2beta1.AsyncBatchAnnotateFilesResponse",
        "responses": [
            {
                "outputConfig": {
                    "gcsDestination": {
                        "uri": "gs://<your bucket name>/output/"
                    },
                    "batchSize": 1
                }
            }
        ]
    }
}

4) 查看指定谷歌云存储文件夹中的结果

【讨论】:

【解决方案2】:

2016 年,Cloud Vision 不支持 PDF 和 TIFF 格式。

接受的格式是:(取自doc

  • JPEG
  • PNG8
  • PNG24
  • GIF
  • 动画 GIF(仅限第一帧)
  • BMP
  • WEBP
  • 原始
  • ICO

但现在被添加了。

jpg 的文档:

https://cloud.google.com/vision/docs/ocr

pdf的文档

https://cloud.google.com/vision/docs/pdf

【讨论】:

  • 是否可以在不通过临时文件的情况下摄取 TIFF 或 PDF?
  • 此答案现已过时,因为 Cloud Vision 支持 PDF 和 TIFF。
  • 它现在也支持 ocr 的 pdf。 cloud.google.com/vision/docs/…
【解决方案3】:

https://cloud.google.com/vision/docs/pdf

我知道这个问题很老了,但现在 Google Vision 发布了对 PDF 的支持!

【讨论】:

    【解决方案4】:

    现在谷歌云视觉文本检测也可用于 pdf 文件,它以同步方式立即检测 pdf 文件中的文本,并且不需要文件在谷歌存储中,它可以是 base 64 格式。

    HTTP 方法和 URL:

    发布https://vision.googleapis.com/v1/files:annotate 请求 JSON 正文:

    {
      "requests": [
        {
          "inputConfig": {
            "content": "base64-encoded-file",
            "mimeType": "application/pdf"
          },
          "features": [
            {
              "type": "DOCUMENT_TEXT_DETECTION"
            }
          ],
          "pages": [
            1,2,3,4,5
          ]
        }
      ]
    }
    

    更多信息请访问https://cloud.google.com/vision/docs/file-small-batch

    【讨论】:

      猜你喜欢
      • 2023-03-02
      • 1970-01-01
      • 2019-02-19
      • 1970-01-01
      • 1970-01-01
      • 2019-02-05
      • 2017-01-25
      • 2016-07-24
      • 2020-10-22
      相关资源
      最近更新 更多