【发布时间】:2019-01-13 21:14:30
【问题描述】:
我正在处理一个庞大的实验室数据集,想知道如何将 8.9GB 数据集从我的 google 驱动器加载到我的 google colab 文件中。它显示的错误是运行时停止,正在重新启动它。
我已经尝试过 chunksize、nrows、na_filter 和 dask。但是,实施它们可能存在问题。如果你能向我解释如何使用它。我在下面附上我的原始代码。
import pandas as pd
!pip install -U -q PyDrive
from pydrive.auth import GoogleAuth
from pydrive.drive import GoogleDrive
from google.colab import auth
from oauth2client.client import GoogleCredentials
auth.authenticate_user()
gauth = GoogleAuth()
gauth.credentials = GoogleCredentials.get_application_default()
drive = GoogleDrive(gauth)
id = '1M4tregypJ_HpXaQCIykyG2lQtAMR9nPe'
downloaded = drive.CreateFile({'id':id})
downloaded.GetContentFile('Filename.csv')
df = pd.read_csv('Filename.csv')
df.head()
如果您建议我已经尝试过的任何方法,请使用适当且有效的代码。
【问题讨论】:
-
问题与
machine-learning无关 - 请不要向标签发送垃圾邮件(已删除)。 -
您是否尝试过使用mounting your Drive as a filesystem?如果您将内容拆分为多个文件,而不是使用单个 8.9G 文件,您的时间也可能会简单得多。
标签: python-3.x google-colaboratory