【问题标题】:Fast.ai & NLP: Remove unknown words in fast.ai tokenizerFast.ai & NLP:删除 fast.ai 分词器中的未知单词
【发布时间】:2021-04-24 15:14:14
【问题描述】:

我正在构建一个 NLP 模型来对房地产文本进行分类。问题是,在创建数据束时,许多单词都被赋予了xxunk 特殊标记。

我用来生成 TextClasDataBunch 对象的代码:

count = 0
error = True
while error:
    try: 
        data_clas = TextClasDataBunch.from_csv(path, 'text.csv', vocab=data_lm.train_ds.vocab, bs=2)
        error = False
        print(f'failure count is {count}\n')    
    except:
        count = count + 1
        print(f'failure count is {count}')

上面的代码将parcel control number, property account number, parcel id, Property SBL, and PARID分类为xxbos parcel xxunk number,xxbos parcel number,xxbos xxunk xxunk,xxbos xxunk acres,xxbos xxmaj xxunkxxunk 的优势可能会降低我的模型的有效性。

有没有办法在 fast.ai 分词器中包含稀有词?我查看了this 的问题,但目前没有答案。

【问题讨论】:

    标签: python nlp artificial-intelligence fast-ai


    【解决方案1】:

    未知数的处理取决于任务。一般来说,保留“xxunk”是好的。但如果你想删除它,你可以指定你想使用的词汇。

    此外,如果可能,请考虑将您的代码移至 fastai v2。它更易于使用且文档更完善。

    【讨论】:

      猜你喜欢
      • 2022-01-17
      • 1970-01-01
      • 2018-04-02
      • 1970-01-01
      • 2016-02-10
      • 1970-01-01
      • 2015-04-30
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多