【发布时间】:2020-12-02 10:32:57
【问题描述】:
【问题讨论】:
【问题讨论】:
GPT-2 不适用于字符级别,但适用于子词级别。训练的文本片段的最大长度为 1,024 个子词。
它使用基于byte-pair-encoding 的词汇表。在这样的编码下,频繁的词保持不变,不频繁的词被分成几个单元,最终下降到字节级别。在实践中,分割看起来像这样(69 个字符,17 个子词):
Hello , ▁Stack Over flow ! ▁This ▁is ▁an ▁example ▁how _a ▁string ▁gets ▁segment ed .
在训练时,提示和答案没有区别,所以唯一的限制是提示和答案的总和不能超过 1024 个子词。理论上,您可以在此范围之外继续生成,但历史模型认为永远不会更长。
top_k 的选择只影响内存需求。长查询也需要更多内存,但这可能不是主要限制
【讨论】: