我将扩展我们尊敬的微软翻译同事的官方和批准的答案。
是的,它经常发生,是的,它会影响结果模型中的概率。
这样好吗? 视情况而定。
是的,由于上下文不同,特别是在短字符串上,存在目标端冲突,但同样经常有其他原因,以及不合理的不一致。
最好实际查看目标端冲突,并根据冲突类型和场景(整体数据集、所需行为和泛型行为)做出执行决策系统。
在某些情况下,训练数据中的目标方冲突是可取的或无害的,但至少同样经常,它们是有害的或需要权衡取舍。
例如,缺少重音符号、错误的编码、讨厌的隐藏字符或其他非人类可读的差异,如双角括号、冲突的语言环境、未翻译的句段、更新样式指南……大多是有害的冲突。一种变体可能是本地化单位,而另一种则不是。而且,通常情况下,一个变体只是一个糟糕的翻译。
通常,这些直接冲突(即具有相同确切来源的片段之间的冲突,可以通过简单的脚本找到)是更广泛数据集中冲突的线索 - 除非您知道什么,否则很难找到你正在寻找。
在更多的 1:1 翻译和创译之间、在准确性和流畅性之间存在权衡。前者名声不好,但风险更小,更健壮。
决定可能是删除、解析或规范化,或者去调试数据集和数据管道。
只是把所有东西都扔进黑匣子里,并在 Manning 和 Schütze 1999 上咕哝了三遍我们信任的深度学习只有在规模——你训练自定义模型的频率,而不是数量的情况下才有意义训练数据 - 太高以至于基本的尽职调查不可行。
要真正了解,您可能需要在有冲突和没有冲突的情况下训练系统,并进行评估和比较。
另一方面,源端噪音和冲突甚至不是真正的冲突,通常是安全的,甚至是有益的。而且它们仍然值得一看。