【发布时间】:2020-04-03 10:14:32
【问题描述】:
希望你能帮助我:)。
我在一家翻译公司工作。
如您所知,每次翻译都包括将原始文本分成小段,然后将它们重新组合成最终产品。
换句话说,句段被视为“翻译单元”。
通常,特别是对于大型文档,翻译人员会犯一些语言一致性错误,我试着用一个例子来解释。
在西班牙语中,您可以根据上下文使用“tu”或“usted”,这决定了句子的正式-非正式语气。
所以,如果你考虑一个文档的这两句话:
Lara, te has lavado las manos? (TU)
Lara usted se lavò las manos? (USTED)
它们都是正确的,但如果您考虑整个文档,就会发现语言不一致。
我在业余时间学习 NLP 基础知识,并且正在研究如何创建一个工具来对一组句子进行语言一致性分析。
我特别关注 Standford CoreNLP(我更喜欢 Java 而不是 Python)。 我想我首先需要一些语言工具来执行动词分析。当然,该工具可以使用不同的语言(EN、IT、ES、FR、PT)。
谁能帮我弄清楚如何开始?
任何帮助将不胜感激,
提前致谢!
【问题讨论】:
-
这种特殊的区别被称为T-V distinction。但问题是还有更多可能的不一致。例如,翻译成有性别的语言可能会强制进行性别选择,这也可能是不一致的。 (例如他/她用英语)
-
感谢@MSalters 的快速回复,我正在深入研究。我知道还有很多可能的不一致之处,但我想 T-V 的区别是最常见的。你能给我推荐任何 NPL 工具/分析吗?
标签: nlp stanford-nlp data-analysis linguistics