【发布时间】:2021-08-17 10:45:26
【问题描述】:
我正在处理具有 3 个标签(0、1、2 = neg、pos、neu)的分类任务。数据是句子。因此,为了生成句子的向量/嵌入,我使用一个 Bert 编码器来获取每个句子的嵌入,然后我使用一个简单的 knn 进行预测。
我的数据是这样的:每个句子都有一个标签和其他分类数值。
例如,我的数据是这样的
Sentence embeddings_BERT level sub-level label
je mange [0.21, 0.56] 2 2.1 pos
il hait [0.25, 0.39] 3 3.1 neg
.....
如您所见,每个句子都有其他类别,但不是最后一个类别,而是在人类注释数据时帮助确定标签的索引。我希望我的模型在预测标签时考虑这两个值。我想知道是否必须将它们与由 bert 编码生成的嵌入连接起来,还是有其他方法?
【问题讨论】:
标签: python python-3.x bert-language-model word-embedding