【发布时间】:2011-03-10 14:21:58
【问题描述】:
我正在为音盲人士开发一个程序。我一直在使用 sapi 和 TTs。该程序同时用一只手制作 3D 动画。但问题是声音(即使是最慢的声音)对于我想要的东西来说太快了。所以,我想过语音识别,但问题是我必须在动画开始之前对文本做一个大的处理。
所以,我想知道是否可以进行语音识别(从我在 .wave 文件上的声音),然后执行相同的 TT 过程(使用 Sapi 事件...),但使用 .wave 和我的声音。
如果可能,请告诉我如何。如果您认为有更好的选择,请让我看看。
感谢您的宝贵时间(请原谅我的英语)
耶苏斯基维茨
【问题讨论】:
-
您确定不能只将动画与视位或音位事件同步吗?另外,为什么不在将文本发送到 TTS 引擎之前处理文本?
-
不,因为即使将 TTS 配置为以最慢的速度说话,也太快了,而且它还会以机器人的方式发出声音。此外,动画是在音节级别引用的,所以无法实时同步。
-
所以,如果我对问题的理解正确,您有一些文本,并且您想使用 TTS,但您还需要将 TTS 与签名动画同步。您遇到的问题是签名动画相对较长,并且您正在失去同步。我(尚未)理解的是当动画太长时你想要发生的事情 - 你想在单词之间插入停顿吗?
-
不完全是。我想说一段文字(带麦克风),并在该语音注册到 wav 文件的同时识别该文本。然后,使用波形文件并用该波形文件的声音唱动画。所以我只想将来自 wav 的声音与动画同步。为什么要这样做,因为需要对文本进行分析,才能加载正确的动画(语音视位和音素的信息还不够
-
我还是不明白你为什么需要识别wave文件。识别引擎和 tts 引擎之间没有内在的同步(或者,就此而言,识别引擎和实时之间没有任何特定的同步)。那么,您为什么不直接分析文本、生成动画,然后然后将其发送到 TTS 引擎,并根据需要与音素/视位同步?
标签: speech-recognition text-to-speech sapi speech-to-text