【问题标题】:Custom translator - Model adjustment after training自定义翻译器 - 训练后的模型调整
【发布时间】:2020-10-16 14:59:28
【问题描述】:

我使用了三个平行的句子文件来训练我的自定义翻译模型。没有字典文件,也没有调整文件。训练完成并检查测试结果后,我想对模型进行一些调整。这里有几个问题:

  1. 是否可以在训练后调整模型?模型不能改变,唯一的方法是训练一个新模型,我说得对吗?
  2. 调整模型的最佳方法是使用调整文件。对吗?
  3. 无法查看自动生成的调整文件,因此我必须提供自己的调整文件,以便更易于管理的调整过程。是这样吗?
  4. 您能否描述一下调整文件是如何生成的,当我有3个句子文件不同的句子文件时,分别是:55k、24k和58k行。所有的调整语句都是来自第一个文件还是来自所有三个文件,与它们的大小成正比?使用了哪种逻辑?

【问题讨论】:

    标签: microsoft-translator


    【解决方案1】:

    希望对此有更权威的答案,我会分享我作为网友的了解。

    Microsoft 自定义翻译器所称的“tuning data”就是通常所说的validation set。这只是一种避免过拟合的方法。

    1. 是否可以在训练后调整模型?模型不能改变,唯一的方法是训练一个新模型,我说得对吗?

    是的,使用 Microsoft 自定义翻译器,您只能根据您为项目选择的通用类别训练模型。

    (使用 Google AutoML 从技术上讲,您可以选择基于您以前的自定义模型之一来训练新模型。但是,如果不经过反复试验,它也无法使用。)

    1. 调整模型的最佳方法是使用调整文件。对吗?

    很难对此做出明确的陈述。训练集也有效果。在糟糕的训练集之上的良好验证集不会给我们带来好的结果。

    1. 无法查看自动生成的调整文件,因此我必须提供自己的调整文件,以便更易于管理的调整过程。是这样吗?

    是的,在我看来,如果让它决定如何将训练集拆分为训练集、调整集和测试集,则只能下载训练集和测试集。

    也许两者都不包括调整集,所以理论上你可以区分它们。但这并不能解决不同模型之间拆分不同的问题。

    1. ...使用哪种逻辑?

    好问题。

    【讨论】:

    • 我观察到与@AdamBittlingmayer 上面提到的相同的事情。有谁知道事情是否发生了变化?
    猜你喜欢
    • 2017-06-19
    • 2021-01-12
    • 1970-01-01
    • 2021-02-10
    • 1970-01-01
    • 2021-12-15
    • 1970-01-01
    • 1970-01-01
    • 2022-11-10
    相关资源
    最近更新 更多