【发布时间】:2022-10-16 02:57:21
【问题描述】:
我的目标是对一个具有混合形状的头像进行口型同步,例如“a”和“m”。我有文本(通过 GPT-3 动态生成,因此事先不知道)并将其提供给 Google 文本到语音 API,它给了我一个原始音频文件作为回报。我可以以某种方式分析此文件或做其他事情来了解播放音频剪辑时所说的单词吗?这将帮助我将单词解析为音素并相应地调整嘴巴。谢谢!
【问题讨论】:
-
我知道有一些软件可以做到这一点。我已经在以前的雇主那里看到过它在使用,但在运行时不太准确。我没有看到任何团结的东西。
标签: c# unity3d google-text-to-speech