【发布时间】:2012-07-09 04:46:57
【问题描述】:
情况:1GB CSV 文件,100000 行,4000 个自变量,1 个因变量。 R 在 Windows Citrix 服务器上,具有 16GB 内存。
问题:我花了 2 个小时!要做的事:
read.table("full_data.csv", header=T, sep",")
glm 进程崩溃,程序没有响应,我必须在任务管理器中将其关闭。
【问题讨论】:
-
?read.table告诉你如何让它运行得更快。 “进程崩溃”和“程序没有响应”是不同的东西;是哪一个?你等了多久才通过任务管理器杀死 R? -
也许可以试试biglm?
-
程序无响应,等待 10 分钟。
-
biglm 支持逻辑回归吗?
-
或者我可以读取 1~1000 行然后 1001~2000 行然后......?这会使读入过程更快吗?
标签: r bigdata regression logistic-regression read.table