【发布时间】:2018-04-11 05:37:30
【问题描述】:
我有一个大约 12k 文档的利基语料库,我想测试其中具有相似含义的近乎重复的文档 - 想想关于不同新闻机构报道的同一事件的文章。
我尝试过 gensim 的 Word2Vec,即使测试文档在语料库中内,它也给了我可怕的相似度分数( 0.9。我测试了 SpaCy 最相似的文档,但大部分都没用。
这是相关代码。
tfidf = models.TfidfModel(corpus)
corpus_tfidf = tfidf[corpus]
lsi = models.LsiModel(corpus, id2word=dictionary, num_topics=40)
doc = preprocess(query)
vec_bow = dictionary.doc2bow(doc)
vec_lsi_tfidf = lsi[tfidf[vec_bow]] # convert the query to LSI space
index = similarities.Similarity(corpus = corpus, num_features = len(dictionary), output_prefix = "pqr")
sims = index[vec_lsi_tfidf] # perform a similarity query against the corpus
most_similar = sorted(list(enumerate(sims)), key = lambda x:x[1])
for mid in most_similar[-100:]:
print(mid, file_list[mid[0]])
使用 gensim,我找到了一种不错的方法,并进行了一些预处理,但相似度得分仍然很低。有没有人遇到过这样的问题,是否有一些有用的资源或建议?
【问题讨论】:
标签: python-3.x nlp gensim spacy