【问题标题】:does converting from mulaw to linear impact audio quality?从 mulaw 转换为线性会影响音频质量吗?
【发布时间】:2022-01-03 10:45:47
【问题描述】:

我想将音频编码从 mulaw 更改为线性,以便使用 Google 的线性语音识别模型。 我正在使用电话频道,因此音频以 mulaw、8 位、8000Hz 编码。 当我使用 Google Mulaw 模型时,识别一些简短的单词会出现一些问题 -> 基本上它们根本无法识别 -> API 返回无 我想知道更改 Linear 或 Flac 的编码是否是一种好习惯? 我已经做到了,但我无法真正衡量这种改进的程度。

【问题讨论】:

  • 嗨@ylvi-bux,如果我的回答解决了您的问题,请考虑接受并支持它。如果没有,请告诉我,以便我改进答案。

标签: audio speech-to-text google-speech-api google-speech-to-text-api mu-law


【解决方案1】:

对于无头音频数据使用 LINEAR16 或对于有头音频数据使用 FLAC 始终是 best practice。它们都提供无损编解码器。最好将采样率设置为 16000 Hz,否则您可以设置 sample_rate_hertz 以匹配音频源的原生采样率(而不是重新采样)。由于 Google Speech to Text API 提供了多种提高音频质量的方法,您可以使用World Level Confidence 来衡量响应的准确性。

【讨论】:

    【解决方案2】:

    理想情况下,首先使用无损编解码器(如 linear16 ot flac)录制音频。但是,一旦您将其转换为 mulaw 等格式,然后再将其发送到 Google 语音转文本,则无济于事。

    考虑使用model=phone_calluse_enhanced=true 以获得更好的电话质量。 如需快速实验,您可以使用 STT UI https://cloud.google.com/speech-to-text/docs/ui-overview

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2023-01-18
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多