【发布时间】:2015-11-09 14:08:12
【问题描述】:
在我的系统上,使用我的 USB 麦克风,我发现最适合 CMU Sphinx 的音频电平约为最大值的 20%。这给了我 75% 的语音识别准确率。如果我以数字方式放大它,我的识别准确率会差得多(25%)。为什么是这样? Sphinx 的推荐音频级别是多少? [另外我正在使用 16,000 个样本/秒,16 位。]
【问题讨论】:
在我的系统上,使用我的 USB 麦克风,我发现最适合 CMU Sphinx 的音频电平约为最大值的 20%。这给了我 75% 的语音识别准确率。如果我以数字方式放大它,我的识别准确率会差得多(25%)。为什么是这样? Sphinx 的推荐音频级别是多少? [另外我正在使用 16,000 个样本/秒,16 位。]
【问题讨论】:
pocketsphinx 解码器使用通道幅度归一化。初始归一化值实际上在模型内部配置为 20% 的音频电平(feat.params 中的 -cmninit 参数)。但是,级别会在您解码时更新,因此它仅对第一个话语有影响。如果您在连续模式下正确解码,则级别应该无关紧要。不要为每个话语重新启动识别器,让它适应噪音和音频级别。
【讨论】: