【发布时间】:2014-12-29 13:55:53
【问题描述】:
我的数据集不是英文的,而是韩文的。 观察次数超过3000次。
数据集的名字是demo。
str(demo)
这有每行中每个人的信息。
$ 거주지역: Factor w/ 900 levels "","강원 강릉시 포남1동",..: 595 235 595 832 12 126 600 321 600 589 ...
上面是第4列数据集的结构。
我想根据指示人员地址的第 4 列进行分组。 问题是因子的级别是 900。这是因为地址已完全写入。
我想组组分配一些省份的人。因此,R 需要读取因子并识别字母以进行分组。
我该怎么做?请帮帮我。 google了很久都没找到。
【问题讨论】:
-
我了解您想制作
groups。但是,如果没有进一步的信息以及可重复的数据(英文),就很难提供帮助。 -
嗨,问题是您需要对给出完整地址的字符串进行子集化以提取省份吗?地址中的省份总是在同一个地方吗?首先,您可以查看
strsplit或gsub。 -
@andybega 确实,它总是在地址中的同一个地方。
-
@akrun 我不确定您是否可以阅读可重现的数据,因为它不是英文的。不过我可以试试。
-
@DooHyunShin 不,我不能:-)
标签: r street-address