【发布时间】:2021-04-24 15:14:14
【问题描述】:
我正在构建一个 NLP 模型来对房地产文本进行分类。问题是,在创建数据束时,许多单词都被赋予了xxunk 特殊标记。
我用来生成 TextClasDataBunch 对象的代码:
count = 0
error = True
while error:
try:
data_clas = TextClasDataBunch.from_csv(path, 'text.csv', vocab=data_lm.train_ds.vocab, bs=2)
error = False
print(f'failure count is {count}\n')
except:
count = count + 1
print(f'failure count is {count}')
上面的代码将parcel control number, property account number, parcel id, Property SBL, and PARID分类为xxbos parcel xxunk number,xxbos parcel number,xxbos xxunk xxunk,xxbos xxunk acres,xxbos xxmaj xxunk。 xxunk 的优势可能会降低我的模型的有效性。
有没有办法在 fast.ai 分词器中包含稀有词?我查看了this 的问题,但目前没有答案。
【问题讨论】:
标签: python nlp artificial-intelligence fast-ai