【发布时间】:2011-01-17 07:04:14
【问题描述】:
我无法从this research paper 确定如何根据训练数据集重现标准矢量量化算法来确定身份不明的语音输入的语言。以下是一些基本信息:
摘要信息 使用声学特征的语言识别(如日语、英语、德语等)是当前语音的一个重要而困难的问题 技术。 ... 本文使用的语音数据库包含 20 种语言:16 4名男性和4名女性说出两次的句子。每次的持续时间 句子大约8秒。第一种算法是基于标准的 矢量量化(VQ)技术。每种语言都有其特点 通过自己的 VQ 码本,。
识别算法
第一种算法基于标准矢量量化 (VQ) 技术。每种语言 k 都有自己的 VQ 码本 。在识别阶段,输入语音被量化,并计算累积量化失真d_k。作为最小失真的语言被识别。计算 VQ 失真,应用了几个 LPC 频谱失真测量...在这种情况下,WLR -- 加权最小比率 -- 距离:
距离d可以是任何与声学特征相对应的距离,它必须与生成码本的距离相同。每种语言都有其 VQ 码本 。
我的问题是,我该怎么做?我有一组50个英语句子。在 MATLAB 中,我可以轻松计算任何给定信号的 WLR。但是,我该如何制定码本,因为我必须使用 WLR 来生成英语的“码本”。我也很好奇如何将大小为 16 的 VQ 码本(被发现是最佳大小)与给定的输入信号进行比较。如果有人能帮我提炼这篇论文,我将不胜感激。
谢谢!
【问题讨论】:
标签: vector speech audio-processing quantization