【发布时间】:2018-12-05 07:31:15
【问题描述】:
我有一个非常大 (4gb) 的 csv 文件。无法在 excel 或其他编辑器中打开。行(行)数近3000,列数近320000。
一种解决方案是将原始文件拆分为较小的文件,并能够在 Excel 或其他编辑器中打开这些小文件。
第二种解决方案是对原始数据进行转置,然后在 Excel 中打开。
我找不到用于转置的工具或脚本。我找到了一些用于拆分的脚本和免费软件,但它们中的每一个都按行大小拆分 csv。
有没有办法将原始文件拆分为最多包含 15000 行的较小文件。
我尝试使用:
将熊猫导入为 pd pd.read_csv(%file Path%).T.to_csv('%new File Path%,headre=false)
但需要很长时间才能完成
【问题讨论】:
-
The second solution is to take the transpose...这根本不会改变数据集的大小,它仍然可能无法在 Excel 中打开。即使是这样,预计性能会非常缓慢。您使用这些数据的目标是什么?您是否考虑过使用 R 或 Matlab 等工具? -
数据集包含遗传信息。列将 SNP 存储为 rs id,行包含该 SNP 的等位基因变化。我想过滤那些 SNP。将 SNP 数量从 300,000 减少到 900
标签: csv split large-files