【发布时间】:2015-10-21 16:34:07
【问题描述】:
我正在尝试将 .csv 文件读入 R。该 .csv 文件是在 Excel 中创建的,它包含“长”破折号,这是 Excel“自动更正”序列空格破折号的结果-空间。包含这些“长”破折号的示例条目:
美国 - 加利福尼亚 - 洛杉矶
美国 - 华盛顿 - 西雅图
我尝试了不同的编码,包括以下三个选项:
x <- read.csv(filename, encoding="windows-1252") # Motivated by http://www.perlmonks.org/?node_id=551123
x <- read.csv(filename, encoding="latin1")
x <- read.csv(filename, encoding="UFT-8")
但是,长破折号要么显示为 �(第一个和第二个选项),要么显示为 <U+0096>(第三个选项)。
我意识到我可以以不同的格式存储文件或使用不同的软件 (Excel to CSV with UTF8 encoding),但这不是重点。
有没有人弄清楚 R 中的哪种编码选项在这种情况下有效?
【问题讨论】:
-
对于第三个选项,您还可以在之后清理数据,例如
gsub("<U+0096>", "", x, fixed=TRUE)