【发布时间】:2014-06-16 13:38:29
【问题描述】:
我正在使用 R Studio,需要导入一个 csv 文件以进行文本挖掘。 该文件采用 windows-1252 编码并包含德语变音符号。
但是我无法让 R 正确导入这些变音符号。使用 read.table(X,fileEncoding="UTF-8") 会导致错误。
我错过了什么?
----更新----
我要阅读的文件是: https://drive.google.com/file/d/0B4kGh2YwTmb9U3hkei1TTHlUME0/edit?usp=sharing
使用这个 R 代码:
Sys.setlocale("LC_CTYPE", "german")
dataset <- read.table("../processed/DE_all_CDM_201405050001_DE_all_CDM2014-05-05_rcout.csv", encoding="UTF-8", header=TRUE, sep=";", stringsAsFactors=F, as.is=T)
dataset <- dataset[,c(1,11,30)]
Encoding(dataset[,2]) <- "UTF-8"
【问题讨论】:
-
你读过
read.table中的“注意”部分吗? -
是的,但我不确定我是否理解正确。我的语言环境是:“LC_COLLATE=German_Germany.1252;LC_CTYPE=German_Germany.1252;LC_MONETARY=German_Germany.1252;LC_NUMERIC=C;LC_TIME=German_Germany.1252”我正在运行 Windows...
-
你设置 Sys.Locale 了吗?
-
您可能想阅读此内容。它适用于俄语,但同样适用于任何外语quantifyingmemory.blogspot.ie/2013/01/…
-
我不会为了下载您的文件而注册 Google ...