【发布时间】:2021-12-23 22:50:45
【问题描述】:
我正在关注this OpenAI tutorial 进行微调。
我已经使用 openai 工具生成了数据集。问题是输出编码(推理结果)混合了 UTF-8 和非 UTF-8 字符。
生成的模型如下所示:
{"prompt":"Usuario: Quién eres\\nAsistente:","completion":" Soy un Asistente\n"}
{"prompt":"Usuario: Qué puedes hacer\\nAsistente:","completion":" Ayudarte con cualquier gestión o ofrecerte información sobre tu cuenta\n"}
例如,如果我问“¿Cómo estás?”并且该句子有一个经过训练的补全:“Estoy bien, ¿y tú?”,推理通常返回完全相同(这很好),但有时它会添加非编码词:“Estoy bien, ¿y tú? Cuà ©ntame algo de ti”,添加“é”而不是“é”。
有时,它返回的句子与经过训练的句子完全相同,没有编码问题。 我不知道推理是从我的模型中还是从其他地方获取非编码字符。
我该怎么办? 我应该用 UTF-8 编码数据集吗? 我应该使用 UTF-8 保留数据集并解码响应中的错误编码字符吗?
用于微调的 OpenAI 文档不包含任何关于编码的内容。
【问题讨论】:
标签: utf-8 character-encoding openai gpt-3 fine-tune