【发布时间】:2023-03-12 04:10:01
【问题描述】:
R中是否有任何功能或方法来检测文本乱码?
我在 Google 上进行了一些搜索,但找不到有希望的东西(似乎在 python 或其他环境中发生了一些很酷的事情)。
所以假设以下文本:
my_texts <- c("akshdvas", "fsd", ".....-----asdknl", "real text", "aaaaaaaaaaaaaaa")
我现在想了解一下哪些元素可以被认为是乱码(在这种情况下,前三个 + 第五个元素)。这可以是简单的 TRUE/FALSE 分类,也可以是某种显示乱码程度的度量(如距离度量)。
注意:我知道乱码的定义可能很模糊,在一个域中被认为是乱码的东西在其他情况下可能是有效的字符串,但假设我想检测是否有人只是随机敲击他们的键盘。
我正在考虑的另一种方法是相反的,即检测我的向量中的字符串(或单个单词)是否出现在字典中,如果没有则认为这是乱码。
【问题讨论】: