【发布时间】:2020-10-02 18:18:54
【问题描述】:
问题:我正在寻找一种调试工具/方法,当PocketSphinx.js 无法识别我定义的自定义词时,我可以使用它来发现问题所在。具体来说,我希望能够看到PocketSphinx.js 在无法识别单词时实际听到的音素。
详情:
我正在为网站开发语音界面。我需要使用自定义关键字,我正在使用PocketSphinx.js。我选择的自定义关键字是“Berk-o-bot”,CMU pronunciation 是“B ER K OW B AA T”。我在识别这个短语方面的成功率很低。 (我只认出大约四分之一的时间我会缓慢而有意识地说出这个词,如果我以正常速度说话,则永远不会。) 注意:
如果我将单词分成更小的块(Berk [B ER K]、Berk-O [B ER K OW]、O-bot [OW B AA T] 或 bot [B AA T]),更小的块很容易识别。
失败尝试的想法:
- 我怀疑识别器有困难,因为第一个和第三个音节有重音,但不是第二个。我尝试在发音 [B ER1 K OW0 B AA2 T] 中添加Arpabet Stress Symbols,但是当我尝试将单词添加到字典时,pocketsphinx.js 抛出了错误。
- 我还尝试在字典中添加多个发音,例如 BERK-O-BOT(2) [B ER K AO B AA T]、BERK-O-BOT(3) [B ER K AH B AA T] , BERK-O-BOT(4) [B ER K EH B AA T], BERK-O-BOT(5) [B ER K UH B AA T] 但在识别方面没有看到任何改进。
- 我是 pocketsphinx.js 的新手,所以上述两种方法可能有效,但我可能执行不正确。
【问题讨论】:
标签: speech-recognition cmusphinx pocketsphinx