【发布时间】:2010-09-27 23:01:11
【问题描述】:
我认为我一开始就没有问正确的问题。
新问题: 我有一个 1.5gig 的 tsv 文件。它的顶部有 6 行垃圾,底部有 1 行垃圾,我想删除所有这些,而无需打开文件。第 7 行是标题。我有 13 个标题。行数未知。
如何将文件读入数据框,以便进行基本的描述性统计、箱线图等......
原问题:
嗨
我觉得这个真的很容易。我只是错过了一些东西。
我有一个 txt 文件,用制表符分隔,顶部有 6 行垃圾,底部也有 6 行垃圾。 在垃圾之间,我有表格数据 标签1 标签2 标签3 标签4....标签13 文本 ID 数字百分比....数字
这是我在 R 中输入的内容:
datadump <- read.delim2("truncate.txt", header=TRUE, skip="6")
cleandata <- datadump[c(-dim(datadump)[1]),]
avgposition <- cleandata$Avg.Position
hist(avgposition)
Avg.Position 是 label13 和一些表单 #.#
但我得到一个错误: hist.default(avgposition) 中的错误:“x”必须是数字
为什么它没有将数据视为数字?
谢谢!
这里要求提供一些数据:
> dput(cleandata)
structure(list(Account = structure(c(2L, 2L), .Label = c("Crap1",
"XXS"), class = "factor"), Campaign = structure(c(1L, 1L), .Label = c("3098012",
"Crap2"), class = "factor"), Customer.Id = structure(c(2L, 2L
), .Label = c("", "nontech broad (7)"), class = "factor"), Ad.Group = structure(c(2L,
2L), .Label = c("", "RR 236 (300)"), class = "factor"), Keyword = structure(2:3, .Label = c("",
"chagall pro", "matisse"), class = "factor"), Keyword.Matching = structure(c(2L,
2L), .Label = c("", "Broad"), class = "factor"), Impressions = c(4L,
16L), Clicks = c(1L, 1L), CTR = structure(2:3, .Label = c("",
"25.00%", "6.25%"), class = "factor"), Avg.CPC = structure(2:3, .Label = c("",
"$0.05 ", "$0.11 "), class = "factor"), Avg.CPM = structure(2:3, .Label = c("",
"$12.50 ", "$6.88 "), class = "factor"), Cost = structure(2:3, .Label = c("",
"$0.05 ", "$0.11 "), class = "factor"), Avg.Position = structure(2:3, .Label = c("",
"3", "3.1"), class = "factor")), .Names = c("Account", "Campaign",
"Customer.Id", "Ad.Group", "Keyword", "Keyword.Matching", "Impressions",
"Clicks", "CTR", "Avg.CPC", "Avg.CPM", "Cost", "Avg.Position"
), row.names = 1:2, class = "data.frame")
【问题讨论】:
-
能否发布几行文本文件的确切内容?
-
修改了数据以保持匿名,但本质上我有 1 gig 的形式:
-
尝试使用 head(x, 5) 然后复制并粘贴一个 dput(x) 它使人们更容易查看您的示例。
标签: r