【发布时间】:2020-05-20 21:57:46
【问题描述】:
参考 Huggingface 中很棒的 Transformers 库的 documentation,我遇到了 add_tokens 函数。
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
model = BertModel.from_pretrained('bert-base-uncased')
num_added_toks = tokenizer.add_tokens(['new_tok1', 'my_new-tok2'])
model.resize_token_embeddings(len(tokenizer))
我通过在默认词汇表中添加以前不存在的单词来尝试上述方法。然而,在保持其他所有因素不变的情况下,我注意到使用更新后的tokenizer 的微调分类器的准确性有所下降。即使只添加了 10% 的先前缺失的单词,我也能够复制类似的行为。
我的问题
- 我错过了什么吗?
-
add_tokens函数是否需要屏蔽标记,而不是整个单词,例如:'##ah'、'##red'、'##ik'、'##si' 等?如果是,是否有生成此类掩码令牌的程序?
任何帮助将不胜感激。
提前致谢。
【问题讨论】:
标签: pytorch bert-language-model huggingface-transformers