【问题标题】:Debugging speech recognition of custom word PocketSphinx.js调试自定义词PocketSphinx.js的语音识别
【发布时间】:2020-10-02 18:18:54
【问题描述】:

问题:我正在寻找一种调试工具/方法,当PocketSphinx.js 无法识别我定义的自定义词时,我可以使用它来发现问题所在。具体来说,我希望能够看到PocketSphinx.js 在无法识别单词时实际听到的音素。

详情:
我正在为网站开发语音界面。我需要使用自定义关键字,我正在使用PocketSphinx.js。我选择的自定义关键字是“Berk-o-bot”,CMU pronunciation 是“B ER K OW B AA T”。我在识别这个短语方面的成功率很低。 (我只认出大约四分之一的时间我会缓慢而有意识地说出这个词,如果我以正常速度说话,则永远不会。) 注意: 如果我将单词分成更小的块(Berk [B ER K]、Berk-O [B ER K OW]、O-bot [OW B AA T] 或 bot [B AA T]),更小的块很容易识别。

失败尝试的想法:

  • 我怀疑识别器有困难,因为第一个和第三个音节有重音,但不是第二个。我尝试在发音 [B ER1 K OW0 B AA2 T] 中添加Arpabet Stress Symbols,但是当我尝试将单词添加到字典时,pocketsphinx.js 抛出了错误。
  • 我还尝试在字典中添加多个发音,例如 BERK-O-BOT(2) [B ER K AO B AA T]、BERK-O-BOT(3) [B ER K AH B AA T] , BERK-O-BOT(4) [B ER K EH B AA T], BERK-O-BOT(5) [B ER K UH B AA T] 但在识别方面没有看到任何改进。
  • 我是 pocketsphinx.js 的新手,所以上述两种方法可能有效,但我可能执行不正确。

【问题讨论】:

    标签: speech-recognition cmusphinx pocketsphinx


    【解决方案1】:

    您需要首先使用 pocketsphinx_continuous 和预先录制的音频文件使其在桌面上工作。成功后,您可以在具有相同配置和模型的网络浏览器中尝试。

    如果仍然无法获得更详细的帮助,您可以共享音频文件和配置/模型。

    【讨论】:

    • 喇叭可以用于语音转文本吗?或任何其他类似的库,除了 Google 的文本转语音引擎?
    • 我非常感谢指向新项目的指针。我的最终目标是找到最明智的方法,让我的语音引擎识别超过 5,300 个单词,其中超过 300 个是专有名词(公司名称、城市名称等),并且最好能够进行连续识别,以便它可以通过关键字(“Berk-o-bot”)激活我一直在查看 honkling,但还没有找到有关如何添加自定义单词的文档。这是鸣喇叭能做到的吗?
    • 不,鸣喇叭仅用于激活关键字。其余的必须由语音 API 处理。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多