【发布时间】:2017-04-04 08:42:47
【问题描述】:
我有一堆已翻译的文章,我想将其用作 IBM Watson 语言翻译的训练数据。使用这些文章进行培训的正确方法是什么?我是使用整篇文章及其翻译作为平行语料库中的条目,还是必须将文章拆分成句子并将其翻译对作为条目?
【问题讨论】:
标签: ibm-cloud ibm-watson machine-translation
我有一堆已翻译的文章,我想将其用作 IBM Watson 语言翻译的训练数据。使用这些文章进行培训的正确方法是什么?我是使用整篇文章及其翻译作为平行语料库中的条目,还是必须将文章拆分成句子并将其翻译对作为条目?
【问题讨论】:
标签: ibm-cloud ibm-watson machine-translation
你有两个选择。
要么将文本拆分成短语对,每个短语都带有 from 和 to,然后创建一个forced_glossary 或一个parallel_corpus。
或将所有翻译文本作为单个文件发送以创建单语语料库。
详细文档可在https://www.ibm.com/watson/developercloud/doc/language-translator/customizing.html#training 获得 API 文档位于https://www.ibm.com/watson/developercloud/language-translator/api/v2/?curl#create-model
【讨论】: