【问题标题】:Splitting Large CSV files by Column按列拆分大型 CSV 文件
【发布时间】:2018-12-05 07:31:15
【问题描述】:

我有一个非常大 (4gb) 的 csv 文件。无法在 excel 或其他编辑器中打开。行(行)数近3000,列数近320000。

一种解决方案是将原始文件拆分为较小的文件,并能够在 Excel 或其他编辑器中打开这些小文件。

第二种解决方案是对原始数据进行转置,然后在 Excel 中打开。

我找不到用于转置的工具或脚本。我找到了一些用于拆分的脚本和免费软件,但它们中的每一个都按行大小拆分 csv。

有没有办法将原始文件拆分为最多包含 15000 行的较小文件。

我尝试使用:

将熊猫导入为 pd pd.read_csv(%file Path%).T.to_csv('%new File Path%,headre=false)

但需要很长时间才能完成

【问题讨论】:

  • The second solution is to take the transpose ...这根本不会改变数据集的大小,它仍然可能无法在 Excel 中打开。即使是这样,预计性能会非常缓慢。您使用这些数据的目标是什么?您是否考虑过使用 R 或 Matlab 等工具?
  • 数据集包含遗传信息。列将 SNP 存储为 rs id,行包含该 SNP 的等位基因变化。我想过滤那些 SNP。将 SNP 数量从 300,000 减少到 900

标签: csv split large-files


【解决方案1】:

与此同时,我厌倦了使用一些 python 编码,但由于内存问题,它们都失败了。

Delimit 的试用版 (http://www.delimitware.com/) 完美地处理了数据。

【讨论】:

    猜你喜欢
    • 2017-01-27
    • 1970-01-01
    • 2012-04-14
    • 1970-01-01
    • 1970-01-01
    • 2022-01-16
    • 1970-01-01
    • 1970-01-01
    • 2013-03-04
    相关资源
    最近更新 更多