【发布时间】:2016-03-04 12:09:41
【问题描述】:
我正在尝试根据它们之间的距离(相似性/不相似性)对英文字母进行聚类。有人知道公式可能会有所帮助吗?
我搜索过,我看到的大部分是中文、泰文或韩文字母。
字母之间的相似性/相异性取决于字母的形状。例如,“M”和“W”相似,“O”和“Q”也相似。但是,字母“E”和“S”不同,“P”和“C”也不同。
【问题讨论】:
-
是什么让两个形状相似,对你来说?这也可以通过多种方式定义
-
@BradThomas 你是对的。非常好的问题。从我读到的一篇论文中,他们以这种方式分发它:1-带有锐角的字母(S,Z)。 2- 强大的水平垂直分量(E、F、L)。 3- 弯曲字母(B、D、C、O、Q、G)。 4- 垂直平分的字母,对称或近似于水平轴(K、H、X)。 5- 大部分对角线字母(M、W、V、U、Y、A)。 6- 具有强垂直分量的字母(J、I、T)。但是,我需要一些东西来作为这些分布的基础,因为我可能想根据它们的不同来分布它们。我希望它现在更有意义。
-
@BradThomas 但是,如果有任何其他信件的分发非常受欢迎。
-
那篇论文描述了一个实证实验,人类受试者根据他们想要的任何标准对字母对的视觉相似性进行评分。然后对该 52x52 相似度评级矩阵进行解释,以获得各种“弯曲”、“垂直”、“倾斜”等特征解释。如果您同意,您可以编写特征提取软件来实现它。否则,您可以返回原始数据并自己重新解释以找出一组不同的特征。或者您可以决定整个实验与您的目标无关
-
附注该论文的原始数据已转录至此处:obereed.net/lettersim/BolesClifford1989.html,该站点还包含其他有关字母相似性的论文和数据集的存档:obereed.net/lettersim/index.html
标签: cluster-analysis data-mining