【问题标题】:Encoding issues on OpenAI predictions after fine-tuning微调后 OpenAI 预测的编码问题
【发布时间】:2021-12-23 22:50:45
【问题描述】:

我正在关注this OpenAI tutorial 进行微调。

我已经使用 openai 工具生成了数据集。问题是输出编码(推理结果)混合了 UTF-8 和非 UTF-8 字符。

生成的模型如下所示:

{"prompt":"Usuario: Quién eres\\nAsistente:","completion":" Soy un Asistente\n"}
{"prompt":"Usuario: Qué puedes hacer\\nAsistente:","completion":" Ayudarte con cualquier gestión o ofrecerte información sobre tu cuenta\n"}

例如,如果我问“¿Cómo estás?”并且该句子有一个经过训练的补全:“Estoy bien, ¿y tú?”,推理通常返回完全相同(这很好),但有时它会添加非编码词:“Estoy bien, ¿y tú? Cuà ©ntame algo de ti”,添加“é”而不是“é”。

有时,它返回的句子与经过训练的句子完全相同,没有编码问题。 我不知道推理是从我的模型中还是从其他地方获取非编码字符。

我该怎么办? 我应该用 UTF-8 编码数据集吗? 我应该使用 UTF-8 保留数据集并解码响应中的错误编码字符吗?

用于微调的 OpenAI 文档不包含任何关于编码的内容。

【问题讨论】:

    标签: utf-8 character-encoding openai gpt-3 fine-tune


    【解决方案1】:

    我在处理葡萄牙语字符串时遇到了同样的问题。

    尝试在字符串后使用.encode("cp1252").decode()

    "Cuéntame algo de ti".encode("cp1252").decode()
    

    这应该会导致:

    "Cuéntame algo de ti"
    

    cp1252 与 windows-1252 西欧编解码器有关。如果这不起作用,请从这里尝试另一个编解码器: https://docs.python.org/3.7/library/codecs.html#standard-encodings

    【讨论】:

    • 对包含编码和解码字符的字符串执行此操作时会出现问题,就是这种情况。所以我认为这是因为模型合并了不同的句子,一些编码良好,一些错误,所以这个问题并没有解决。也许我错误地训练了模型......一个例子是:“Estoy bien, ¿y tú? Cuéntame algo de ti”。有了这句话,我不知道该怎么办了。
    猜你喜欢
    • 2022-12-14
    • 2022-06-22
    • 2023-01-19
    • 2019-07-14
    • 2015-04-08
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-11-21
    相关资源
    最近更新 更多