【问题标题】:How are Speech-to-Text and Video Intelligence SPEECH_TRANSCRIPTION related?语音转文本和视频智能 SPEECH_TRANSCRIPTION 有何关联?
【发布时间】:2021-03-25 20:40:05
【问题描述】:

我的目标是使用语音转文本模型处理多个视频。

令人困惑的是,Google 有两种产品似乎做同样的事情。

这些产品之间的主要区别是什么?

  1. 谷歌云语音转文本:https://cloud.google.com/speech-to-text/docs/basics

    • Speech-to-Text 具有用于解释音频的“增强型视频”模型。
  2. 谷歌视频情报:https://cloud.google.com/video-intelligence/docs/feature-speech-transcription

    • VI 可以选择请求SPEECH_TRANSCRIPTION 功能

【问题讨论】:

    标签: google-cloud-platform speech-to-text google-speech-to-text-api video-intelligence-api


    【解决方案1】:

    两者的主要区别在于使用的输入。 Speech to Text API 仅接受音频输入,而 Video Intelligence 接受视频输入。

    正如您的问题“Speech to Text 具有增强视频模型” 中所述,这意味着它具有旨在转录源自视频文件的音频的模型。这意味着原始文件是视频,然后转换为音频。正如tutorial 中所见,视频在转录之前已转换为音频。

    如果您想直接将音频内容转录成文本,我建议使用 Video Intelligence API。您可以使用 Video Intelligence API 关注此tutorial on how to transcribe text。

    【讨论】:

    • 谢谢,你知道后端是否使用相同的模型?我可以期待非常相似的准确性吗?
    • @ProGirlXOXO 是的,它在后端使用相同的模型。是的,您应该期待类似的准确性。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2022-08-24
    • 2012-09-29
    • 2010-11-09
    相关资源
    最近更新 更多