【问题标题】:Find translations of a given word in the corpus e.g. by machine learning, word2vec, text mining在语料库中查找给定单词的翻译,例如通过机器学习、word2vec、文本挖掘
【发布时间】:2022-01-10 17:20:44
【问题描述】:

我正在使用这个线程来获得一些想法并找到一些可能性。

我有大约 1000 篇讲道及其翻译成另一种语言。讲道的长度是不同的。这些是宗教布道文本。由于领域(宗教),有很多词可以根据上下文以不同的方式使用。同一个词可以变成不同的意思。

有没有办法让我“以编程方式”获得目标语言中给定单词的翻译?

x1 -> [y2,z2,a2,b2,c2]
其中 x 是语言 1 中的单词
并且返回的数组包含语言 2 的翻译

这将是最好的情况。也许这可以通过使用领域数据训练翻译模型来实现,但我没有很多数据。

是否可以使用 word2vec?通过创建两个文本(语言 1 和语言 2)的向量空间并使用转换矩阵,是否可以将语义含义放在一起?

你知道其他方法或有其他想法吗?可能已经有这样的作品了吗?这类研究叫什么?我找不到这样的东西。我希望你们对如何实现这一点有一些想法。

一般目的是为该特定领域的研究人员“创建一个工具”,可用于分析讲道的翻译质量。如果您对如何分析翻译质量(语义)有其他想法,我将非常感谢。

【问题讨论】:

    标签: machine-learning text-mining word2vec language-translation machine-translation


    【解决方案1】:

    要获得句子中特定单词的翻译,您可以使用所谓的单词对齐

    要获得翻译质量,您可以使用所谓的质量评估

    machinetranslate.org/quality-estimation

    【讨论】:

      【解决方案2】:

      基于词向量的解决方案(FastText 向量通常比 Word2Vec 更好)当然是可能的。您正在寻找的任务是双语词典归纳。最常用的工具是VecMap,它可以对齐来自两种语言的两个嵌入空间。它要么使用小型种子字典来对齐所有单词,要么甚至可以以完全无人监督的方式工作。

      另一种解决方案是进行单词对齐,即在统计上对齐翻译中的单词。然后,您可以根据单词相互映射的频率获得字典(请注意,当语言在形态上不同时可能会出现问题)。在这种情况下,您可以轻松地展示如何在句子中使用翻译的示例。如果XLM-R model 涵盖了您感兴趣的语言,我建议使用SimAlign(一种神经解决方案)。如果没有,您可以使用Eflomal(统计解决方案)。

      【讨论】:

        猜你喜欢
        • 2017-03-20
        • 1970-01-01
        • 1970-01-01
        • 2011-11-22
        • 1970-01-01
        • 2014-03-31
        • 1970-01-01
        • 2010-12-22
        • 2015-08-03
        相关资源
        最近更新 更多