【问题标题】:Reading big data and logistic regression in R在 R 中读取大数据和逻辑回归
【发布时间】:2012-07-09 04:46:57
【问题描述】:

情况:1GB CSV 文件,100000 行,4000 个自变量,1 个因变量。 R 在 Windows Citrix 服务器上,具有 16GB 内存。

问题:我花了 2 个小时!要做的事:

read.table("full_data.csv", header=T, sep",")

glm 进程崩溃,程序没有响应,我必须在任务管理器中将其关闭。

【问题讨论】:

  • ?read.table 告诉你如何让它运行得更快。 “进程崩溃”和“程序没有响应”是不同的东西;是哪一个?你等了多久才通过任务管理器杀死 R?
  • 也许可以试试biglm
  • 程序无响应,等待 10 分钟。
  • biglm 支持逻辑回归吗?
  • 或者我可以读取 1~1000 行然后 1001~2000 行然后......?这会使读入过程更快吗?

标签: r bigdata regression logistic-regression read.table


【解决方案1】:

我经常使用包sqldf 在内存中加载大的.csv。一个好的指针是here

【讨论】:

    猜你喜欢
    • 2018-01-26
    • 2019-08-20
    • 2014-04-22
    • 1970-01-01
    • 2013-07-24
    • 2018-02-12
    • 2014-06-20
    • 2021-11-13
    • 1970-01-01
    相关资源
    最近更新 更多