【发布时间】:2013-07-25 20:54:34
【问题描述】:
希望这可以用 python 完成!我对相同的数据使用了两个聚类程序,现在两者都有一个聚类文件。我重新格式化了文件,使它们看起来像这样:
Cluster 0:
Brucellaceae(10)
Brucella(10)
abortus(1)
canis(1)
ceti(1)
inopinata(1)
melitensis(1)
microti(1)
neotomae(1)
ovis(1)
pinnipedialis(1)
suis(1)
Cluster 1:
Streptomycetaceae(28)
Streptomyces(28)
achromogenes(1)
albaduncus(1)
anthocyanicus(1)
etc.
这些文件包含细菌种类信息。所以我有簇号(簇 0),然后在它下面的“家族”(布鲁氏菌科)和该家族中的细菌数量(10)。下面是在该科中发现的属(名称后跟编号,布鲁氏菌(10)),最后是每个属中的物种(流产(1)等)。
我的问题:我有 2 个以这种方式格式化的文件,并想编写一个程序来查找两者之间的差异。唯一的问题是两个程序以不同的方式聚类,所以两个聚类可能相同,即使实际的“聚类编号”不同(因此一个文件中的聚类 1 的内容可能与另一个文件中的聚类 43 匹配,唯一不同的是实际的簇号)。所以我需要一些东西来忽略集群编号并专注于集群内容。
有什么方法可以比较这两个文件来检查差异吗?甚至可能吗?任何想法将不胜感激!
【问题讨论】:
-
解析类并比较该类的对象
-
我想你可以在一个集群中有几个家庭,对吧?
-
使用
diff仍然可能是最简单的解决方案。 -
它们是行为和数据的容器。
-
您是否阅读过关于聚类分析的维基百科页面?它讨论了比较两个聚类的外部评估措施。
标签: python algorithm cluster-analysis