【问题标题】:What is the ideal audio level for Sphinx?Sphinx 的理想音频电平是多少?
【发布时间】:2015-11-09 14:08:12
【问题描述】:

在我的系统上,使用我的 USB 麦克风,我发现最适合 CMU Sphinx 的音频电平约为最大值的 20%。这给了我 75% 的语音识别准确率。如果我以数字方式放大它,我的识别准确率会差得多(25%)。为什么是这样? Sphinx 的推荐音频级别是多少? [另外我正在使用 16,000 个样本/秒,16 位。]

【问题讨论】:

    标签: audio cmusphinx


    【解决方案1】:

    pocketsphinx 解码器使用通道幅度归一化。初始归一化值实际上在模型内部配置为 20% 的音频电平(feat.params 中的 -cmninit 参数)。但是,级别会在您解码时更新,因此它仅对第一个话语有影响。如果您在连续模式下正确解码,则级别应该无关紧要。不要为每个话语重新启动识别器,让它适应噪音和音频级别。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2023-03-23
      • 2021-11-18
      • 2020-07-29
      • 2013-03-12
      • 2016-02-05
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多