【发布时间】:2017-10-05 21:49:08
【问题描述】:
有人可以指出我解决以下问题的正确方向吗?
我有一个巨大的 UMLS 医学术语列表,即一个样本可能是
Disease control is good
Disease control is poor
Disease control is excellent
Drug adherence
Current drug
Sodium Valproate
Antibiotic VI
Epilepsy control is good
Frequent seizures
Clinically isolated syndrome
Fractured patella
Fractured femur
我还有另一个短语列表,它们与字符串不完全匹配,但相似,即
Good control of epilepsy --> Epilepsy control is good
Broken tibia --> Fractured tibia
Currently prescribed drugs --> Current drugs
我基本上想从我的第二个短语列表到第一个短语列表中获得最佳匹配。
我知道 ngram 搭配,但这似乎是从单个文本语料库中找到顶部搭配的 ngram,而不是将 ngram 与另一个 ngram 相关联。
我需要研究字符串匹配算法,还是更多基于机器学习的方法?
有没有人知道任何可以做到这一点的包 - 我查看了 python NLTK 并找不到这种类型的功能。
谢谢
【问题讨论】:
标签: python machine-learning nlp associations n-gram