【问题标题】:Clustering algorithm for Voice clustering语音聚类的聚类算法
【发布时间】:2020-06-18 21:35:39
【问题描述】:

我们可以在语音领域使用的最佳聚类方法是什么?

例如,如果我们有来自多个说话者的语音,我们需要将它们聚集到特定的篮子中,每个篮子对应一个说话者。为此,我们可以使用的最佳聚类算法是什么?

【问题讨论】:

    标签: python algorithm machine-learning deep-learning data-science


    【解决方案1】:

    我建议RNN-LSTM。有一个很棒的教程解释了使用这个神经网络的音乐流派分类。我看过它,它非常容易理解:

    1. 首先你必须了解你的音频数据(看看here)。在此链接中,他解释了 MFCC(梅尔频率倒谱系数),它允许您将音频数据的特征提取到频谱图中。在下图中,MFCC 的每个幅度都代表音频的一个特征(例如说话者声音的特征)。
    2. 然后你必须为分类预处理数据(实际示例here)
    3. 然后训练您的神经网络以预测音频属于哪个扬声器。他显示here,但我建议您观看整个系列。我认为这是我所见过的关于这个主题的最好的,它提供了解决此类说话人分类问题所需的所有背景、代码和数据集。

    希望您喜欢这些链接,它们确实帮助了我,并且肯定会解决您的问题。

    【讨论】:

      猜你喜欢
      • 2013-11-26
      • 2018-07-24
      • 2011-03-29
      • 2020-02-14
      • 2022-01-03
      • 2011-08-21
      • 2010-11-28
      • 2011-05-18
      • 2020-12-21
      相关资源
      最近更新 更多