【发布时间】:2019-10-13 22:06:30
【问题描述】:
Watson Language Translator 文档说:
“包含源语言和目标语言并行句子的 TMX 文件。您可以在一个请求中上传多个 parallel_corpus 文件。所有上传的 parallel_corpus 文件加起来,您的并行语料库必须包含至少 5,000 个并行句子才能成功训练。”
我有许多语料库文件,我将使用它们来训练我的翻译模型。我已经查找了以编程方式执行此操作的可能方法,但没有成功。
我发现这样做的唯一方法是将它们手动合并到一个文件中。
有没有办法通过 API 将多个文件作为并行语料库发送?
你能提供 Python 或 Curl 的例子吗?
谢谢。
唯一有效的方法是手动聚合 .TMX 文件并仅发送一个文件。我还没有找到将多个文件作为并行语料库发送的任何方法
with open("./training/my_corpus_SPA.TMX", "rb") as parallel:
custom_model = language_translation.create_model(
base_model_id = 'en-es',
name = 'en-es-base1xx',
#forced_glossary = glossary,
parallel_corpus = parallel).get_result()
print(json.dumps(custom_model, indent=2))
【问题讨论】:
标签: python ibm-cloud customization ibm-watson language-translation