【问题标题】:How to use multiple corpora files to use as parallel corpora in Watson Language Translator in Python如何使用多个语料库文件在 Python 中的 Watson Language Translator 中用作并行语料库
【发布时间】:2019-10-13 22:06:30
【问题描述】:

Watson Language Translator 文档说:

“包含源语言和目标语言并行句子的 TMX 文件。您可以在一个请求中上传多个 parallel_corpus 文件。所有上传的 parallel_corpus 文件加起来,您的并行语料库必须包含至少 5,000 个并行句子才能成功训练。”

我有许多语料库文件,我将使用它们来训练我的翻译模型。我已经查找了以编程方式执行此操作的可能方法,但没有成功。

我发现这样做的唯一方法是将它们手动合并到一个文件中。

有没有办法通过 API 将多个文件作为并行语料库发送?

你能提供 Python 或 Curl 的例子吗?

谢谢。

唯一有效的方法是手动聚合 .TMX 文件并仅发送一个文件。我还没有找到将多个文件作为并行语料库发送的任何方法

with open("./training/my_corpus_SPA.TMX", "rb") as parallel:
custom_model = language_translation.create_model(
base_model_id = 'en-es',
name = 'en-es-base1xx',
#forced_glossary = glossary,
parallel_corpus = parallel).get_result()
print(json.dumps(custom_model, indent=2))

【问题讨论】:

    标签: python ibm-cloud customization ibm-watson language-translation


    【解决方案1】:

    我想我在here找到了解决方案

    我试过这个,它似乎工作:

    open(corpus_fname1, 'rb')parallel1open(corpus_fname2, 'rb')parallel2

     custom_model = language_translation.create_model(
         base_model_id = base_model_es_en,
         name = model01_name,
         parallel_corpus = parallel1,
         parallel_corpus_filename2 = parallel2,
         forced_glossary=None).get_result()
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-01-19
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-07-10
      相关资源
      最近更新 更多