【问题标题】:How to handle large files with s3fs?如何使用 s3fs 处理大文件?
【发布时间】:2018-06-13 15:38:13
【问题描述】:

我正在开发 AWS EMR 集群。我的 S3 存储上有一个数据。清理数据后,我将通过 s3fs 库再次发送到我的 S3 存储。该代码适用于大小在 200-500 mb 之间的文件。但是,当我上传 2.0 到 2.5 GB 大小时。该代码给出了一个错误,即“MemoryError”。你们对这个问题有什么想法或经验吗?

import s3fs
bytes_to_write = nyc_green_20161.to_csv(None).encode()
fs = s3fs.S3FileSystem(key='#', secret='#')
with fs.open('s3://ludditiesnyctaxi/new/2016/yellow/yellow_1.csv', 'wb') as f:
f.write(bytes_to_write)

【问题讨论】:

  • 您可能需要对这些操作进行分块或流式处理。
  • 嗨,你能举个关于块的例子吗?我该如何实现它?

标签: python amazon-web-services


【解决方案1】:

我处理这个问题来拆分我的 csv 文件。这篇文章解释了如何拆分csv文件splitting one csv into multiple files in python

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-06-25
    • 1970-01-01
    • 2013-10-23
    相关资源
    最近更新 更多