【发布时间】:2018-06-24 22:25:09
【问题描述】:
给doc2vec中的一堆句子分配同一个标签有什么效果?我有一个文档集合,我想使用 gensim 来学习向量来执行“文件”分类任务,其中文件是指给定 ID 的文档集合。我有几种标记方式,我想知道它们之间有什么区别,哪种是最好的 -
获取一个文档 d1,为标签分配标签
doc1并训练。为其他人重复获取一个文档 d1,为标签分配标签
doc1。然后将文档标记为句子并为其标签分配标签doc1,然后使用完整文档和单个句子进行训练。为其他人重复
例如(忽略该句子未标记化)-
Document - "It is small. It is rare"
TaggedDocument(words=["It is small. It is rare"], tags=['doc1'])
TaggedDocument(words=["It is small."], tags=['doc1'])
TaggedDocument(words=["It is rare."], tags=['doc1'])
- 与上述类似,但也为每个句子分配一个唯一标签以及
doc1。完整文档包含所有句子标签以及doc1。
示例 -
Document - "It is small. It is rare"
TaggedDocument(words=["It is small. It is rare"], tags=['doc1', 'doc1_sentence1', 'doc1_sentence2'])
TaggedDocument(words=["It is small."], tags=['doc1', 'doc1_sentence1'])
TaggedDocument(words=["It is rare."], tags=['doc1', 'doc1_sentence2'])
我还有一些额外的分类标签要分配。那么最好的方法是什么?
【问题讨论】:
标签: python nlp word2vec gensim doc2vec