【问题标题】:What's the general state of speech recognition right now?目前语音识别的一般状态是什么?
【发布时间】:2012-09-06 23:47:34
【问题描述】:

我目前正在评估语音识别 (SR) 技术的 cyrrebt 状态,似乎有不少 API 和服务如雨后春笋般涌现。

我自己的 SR 经验是,关键字匹配适用于多个说话者,而听写在非常受控的环境中也适用于训练有素的说话者。这仍然是真的吗?是否有任何好的方法可以对任意音频文件的文本进行语音处理 - 可以是从音频流中匹配关键字以进行索引,也可以是尝试完全转录。

对于细微差别与其他引擎与开源解决方案的比较,有人有任何 cmet 吗?

【问题讨论】:

  • 问题应该交给programmers.SE

标签: speech-recognition


【解决方案1】:

虽然围绕语音识别设计的更新和更友好的应用程序将继续被编写,但语音识别本身已经遇到了障碍。即使是最好的引擎,在存在噪音的情况下,其准确性也会迅速下降,这对于经常在嘈杂环境中使用该技术的智能手机用户来说是一个大问题。

一个更大且相关的问题是语音识别器无法从一屋子的声音中识别出一个声音(鸡尾酒会问题),这是大多数人相对容易处理的问题。除非有人解决这个问题,否则语音识别技术恐怕不会有太大进步。这是一个十亿美元的问题,因为一个解决方案将使所有现有的语音识别引擎几乎在一夜之间过时。

【讨论】:

  • 对,所以和我上次看的没什么不同,除了对识别算法的迭代改进。
  • 我想补充一点,Kinects 远程开启麦克风语音识别,是解决鸡尾酒会问题的一大步。即使您不玩电子游戏,我也建议您尝试质量效应 3(或阅读它)。那场比赛有响亮的背景音频。他们在语音命令和游戏方面所做的事情非常酷,因为它在没有一键通解决方案的情况下也能工作。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-02-23
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多