【发布时间】:2021-01-18 16:29:24
【问题描述】:
我正在尝试以一种方式呈现人工输入的单词,使它们的分组更容易被识别为指的是同一事物。本质上是一个拼写检查器。我已经制作了一个大矩阵(实际的矩阵是 250 * 250 ish)。该矩阵的代码与下面给出的可重现示例相同。 (我用随机词生成器填充了它,实际值更有意义但保密)
strings <- c("domineering","curl","axiomatic","root","gratis","secretary","lopsided","cumbersome","oval","mighty","thaw","troubled","furniture","round","soak","callous","melted","wealthy","sweltering","verdant","fence","eyes","ugliest","card","quickest","harm","brake","alarm","report","glue","eyes","hollow","quince","pack","twig","knot")
matrix <- stringdistmatrix(strings, strings, useNames = TRUE)
现在我想创建一个包含两个变量的新表,第一列必须包含成对的“字符串”元素,它们满足字符串距离小于某个数字的条件,例如本示例中的某个数字(stringdist
我感觉这需要 apply 某种函数,但我不知道。
干杯。
【问题讨论】:
标签: r stringdist