【发布时间】:2016-06-28 22:51:03
【问题描述】:
我是一个相对较新的 Python 用户。解析和处理 CSV 并将其加载到本地 Postgres 数据库(在 Python 中)的最佳方法是什么?
建议我使用 CSV 库来解析和处理 CSV。特别是,手头的任务说:
数据可能有错误(某些行可能无法解析), 数据可能重复,数据可能非常大。
我不能在这里使用pandas.read_csv 有什么原因吗?使用 CSV 库是否可以更轻松地解析并将其加载到本地 Postgres 数据库中?特别是,如果我只使用 pandas,如果行不可解析、数据非常大或数据重复,我会遇到问题吗? (最后一点,我知道 pandas 提供了一些相对干净的去重复解决方案)。
我觉得 pandas.read_csv 和 pandas.to_sql 可以在这里为我做很多工作,但我不确定使用 CSV 库是否还有其他优势。
就速度而言,这篇帖子:https://softwarerecs.stackexchange.com/questions/7463/fastest-python-library-to-read-a-csv-file 似乎暗示 pandas.read_csv 表现最好?
【问题讨论】:
-
“最佳”未定义,因此将像现在一样基于意见关闭。
-
对不起,我想这不是最好的标题,但问题更多地在于 cmets。例如,使用
csv库是否让我有更多能力处理非常大的数据集而不是熊猫?还是使用csv库可以更轻松地处理重复项? -
您的困境的一个基石问题可能是找出您的顾问在建议“使用 CSV 库”时的意思。他们很可能只是敦促您不要尝试手动解析它。
标签: python postgresql csv pandas python-3.5