【问题标题】:NLP - linguistic consistency analysisNLP - 语言一致性分析
【发布时间】:2020-04-03 10:14:32
【问题描述】:

希望你能帮助我:)。

我在一家翻译公司工作。

如您所知,每次翻译都包括将原始文本分成小段,然后将它们重新组合成最终产品。

换句话说,句段被视为“翻译单元”。

通常,特别是对于大型文档,翻译人员会犯一些语言一致性错误,我试着用一个例子来解释。

在西班牙语中,您可以根据上下文使用“tu”或“usted”,这决定了句子的正式-非正式语气。

所以,如果你考虑一个文档的这两句话:

Lara, te has lavado las manos? (TU)

Lara usted se lavò las manos? (USTED)

它们都是正确的,但如果您考虑整个文档,就会发现语言不一致。

我在业余时间学习 NLP 基础知识,并且正在研究如何创建一个工具来对一组句子进行语言一致性分析。

我特别关注 Standford CoreNLP(我更喜欢 Java 而不是 Python)。 我想我首先需要一些语言工具来执行动词分析。当然,该工具可以使用不同的语言(EN、IT、ES、FR、PT)。

谁能帮我弄清楚如何开始?

任何帮助将不胜感激,

提前致谢!

【问题讨论】:

  • 这种特殊的区别被称为T-V distinction。但问题是还有更多可能的不一致。例如,翻译成有性别的语言可能会强制进行性别选择,这也可能是不一致的。 (例如他/她用英语)
  • 感谢@MSalters 的快速回复,我正在深入研究。我知道还有很多可能的不一致之处,但我想 T-V 的区别是最常见的。你能给我推荐任何 NPL 工具/分析吗?

标签: nlp stanford-nlp data-analysis linguistics


【解决方案1】:

我不确定Stanford CoreNLP,但如果您考虑这是一个选项,您可以制作自己的标记器并在 pos 标记处使用修饰符。然后,将其用作翻译功能。

换句话说,您可以将它标记为“不定式第二人称中的动词”,而不仅仅是将单词标记为动词。

已经有很好的西班牙语预标记语料库可以帮助您做到这一点。例如,如果您查看Universal Dependencies Ankora Corpus,您可以找到there are annotations referring to the Person of a verb。

稍作调整,您就可以制作一个包含“Verb-1st-Person”或类似内容的组合 PoS,然后训练一个标注器。

我已经写了一篇关于如何在 Python 中执行此操作的文章,但我敢打赌,您可以使用 Weka 在 Java 中执行此操作。 You can read the article here.

在此之后,我想下一步是确保将一个“翻译单元”的人员与另一个“翻译单元”的人匹配,或者以流水线的方式制作一些东西。

【讨论】:

  • 非常感谢您的回复。看了你的文章,很受启发!这似乎是一个很好的起点! :)
  • 顺便说一句,我刚刚注意到我给你指出了错误的文章:P。 Lemmatizing 可以让你到达那里,但不是最佳的。我希望您能够访问 PoS 标记文章,否则,我编辑了答案以包含正确的链接。
猜你喜欢
  • 2011-06-14
  • 1970-01-01
  • 2010-11-27
  • 2021-02-01
  • 2022-07-07
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多