【问题标题】:Speech Recognition based on a collection of audio基于音频集合的语音识别
【发布时间】:2017-10-13 12:48:33
【问题描述】:

我有大量的音频文件及其外语成绩单。
我希望能够识别用户是否从文本中背诵了正确的单词。
我如何开始使用 CMU Sphinx 来解决这个问题?我需要语言模型、声学模型吗?
我想要一些指导以及从哪里开始。

【问题讨论】:

    标签: speech-recognition speech-to-text cmusphinx pocketsphinx sphinx4


    【解决方案1】:

    如何开始使用 CMU Sphinx 解决这个问题?

    您识别音频并将其与转录内容进行比较。如果不匹配,您可以警告您的用户

    我需要语言模型、声学模型吗?

    是的,两者都需要。您可以从您的集合中构建它们,但您仍然需要引导数据。要在这里获得更多建议,值得一提的是语言。

    我想要一些指导以及从哪里开始。

    从教程开始https://cmusphinx.github.io/wiki/tutorial

    【讨论】:

    • 谢谢。语言是希伯来语。你能指点我一个更具体的教程吗?我迷失了所有这些。您能否也给我我需要做的步骤?
    • 好的,希伯来语还不支持,你得自己搭建模型或者使用商业模型。
    • 好的。 1. 有商业版吗?在哪里? 2. 因为我只需要我的音频和成绩单中的单词,这不是更简单吗?如果是这样,我应该采取什么具体方法?
    • 有商用型号,可以联系我参考。由于数据收集要求,声学模型训练通常需要几个月的工作,但如果你有时间,你也可以这样做。您也可以考虑使用 Google Speech API,它支持希伯来语。
    • 我明白了。我想使用 Google Speech API。问题是它不是那么准确。是否可以通过给它一个可能的单词列表来训练它或使其更准确?
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-08-07
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多