【问题标题】:Conflicts in the training data for Microsoft Custom TranslatorMicrosoft 自定义翻译器的训练数据中的冲突
【发布时间】:2021-02-10 05:27:57
【问题描述】:

我正在使用 Microsoft 自定义翻译器并以 tmx 格式提供训练数据。我的训练数据有一些冲突。例如,我有英语到德语的训练数据,其中我有重复的英语字符串,但这些重复的英语字符串的德语翻译是不同的。在这种情况下,它如何影响模型?

【问题讨论】:

  • 我会将这个问题编辑为关于 Conflicts,而不是 Duplicates

标签: training-data microsoft-translator machine-translation


【解决方案1】:

只要一侧不同,它们只是替代翻译,这种情况一直在发生。备选方案将被保留,并影响生成模型中的概率。

【讨论】:

    【解决方案2】:

    我将扩展我们尊敬的微软翻译同事的官方和批准的答案。

    是的,它经常发生,是的,它会影响结果模型中的概率。

    这样好吗? 视情况而定。

    是的,由于上下文不同,特别是在短字符串上,存在目标端冲突,但同样经常有其他原因,以及不合理的不一致。

    最好实际查看目标端冲突,并根据冲突类型和场景(整体数据集、所需行为和泛型行为)做出执行决策系统。

    在某些情况下,训练数据中的目标方冲突是可取的或无害的,但至少同样经常,它们是有害的或需要权衡取舍。

    例如,缺少重音符号、错误的编码、讨厌的隐藏字符或其他非人类可读的差异,如双角括号、冲突的语言环境、未翻译的句段、更新样式指南……大多是有害的冲突。一种变体可能是本地化单位,而另一种则不是。而且,通常情况下,一个变体只是一个糟糕的翻译。

    通常,这些直接冲突(即具有相同确切来源的片段之间的冲突,可以通过简单的脚本找到)是更广泛数据集中冲突的线索 - 除非您知道什么,否则很难找到你正在寻找。

    在更多的 1:1 翻译和创译之间、在准确性和流畅性之间存在权衡。前者名声不好,但风险更小,更健壮。

    决定可能是删除、解析或规范化,或者去调试数据集和数据管道。

    只是把所有东西都扔进黑匣子里,并在 Manning 和 Schütze 1999 上咕哝了三遍我们信任的深度学习只有在规模——你训练自定义模型的频率,而不是数量的情况下才有意义训练数据 - 太高以至于基本的尽职调查不可行。

    要真正了解,您可能需要在有冲突和没有冲突的情况下训练系统,并进行评估和比较。

    另一方面,源端噪音和冲突甚至不是真正的冲突,通常是安全的,甚至是有益的。而且它们仍然值得一看。

    【讨论】:

      猜你喜欢
      • 2017-06-19
      • 1970-01-01
      • 1970-01-01
      • 2019-10-14
      • 1970-01-01
      • 1970-01-01
      • 2020-07-29
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多