【发布时间】:2012-09-06 23:47:34
【问题描述】:
我目前正在评估语音识别 (SR) 技术的 cyrrebt 状态,似乎有不少 API 和服务如雨后春笋般涌现。
我自己的 SR 经验是,关键字匹配适用于多个说话者,而听写在非常受控的环境中也适用于训练有素的说话者。这仍然是真的吗?是否有任何好的方法可以对任意音频文件的文本进行语音处理 - 可以是从音频流中匹配关键字以进行索引,也可以是尝试完全转录。
对于细微差别与其他引擎与开源解决方案的比较,有人有任何 cmet 吗?
【问题讨论】:
-
问题应该交给programmers.SE