【问题标题】:Encoding error: Train BERT from scratch in Vietnamese language编码错误:用越南语从头开始训练 BERT
【发布时间】:2021-05-08 11:52:42
【问题描述】:

我按照这个教程How to train a new language model from scratch using Transformers and Tokenizers

在Section 2. Train a tokenizer中,通过我自己的越南语文本数据进行训练后,我查看生成的.vocab文件,所有的token都变成了这样:

"ĠÄij":268,"nh":269,"á»§":270,"Ãł":271,"Ġch":272,"iá»":273,"á":274,"Ġl":275,"Ġb":276,"ư":277,"Ġh":278,"ế":279,

有什么办法解决这个问题吗?

【问题讨论】:

标签: encoding tokenize bert-language-model huggingface-transformers huggingface-tokenizers


【解决方案1】:

您可以使用 ByteLevel 解码器(ByteLevelBPETokenizer 使用的部分)读取这些令牌,如下所示:

a = tokenizer.encode("thầy giáo rất tốt.").tokens
print(a)
>> ['<s>', 'thầy', 'Ġgiáo', 'Ġrất', 'Ġtá»ijt', '.', '</s>']

from tokenizers.decoders import ByteLevel
decoder = ByteLevel()
decoder.decode(a)
>> <s>thầy giáo rất tốt.</s>

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-09-09
    • 2021-04-15
    • 1970-01-01
    • 2017-12-01
    • 2020-04-07
    • 2020-06-25
    • 1970-01-01
    • 2022-12-10
    相关资源
    最近更新 更多