【发布时间】:2018-09-17 15:51:42
【问题描述】:
我有一个如下所示的 csv:
name: john
date modified: 2018-09
from: jane
colum1 column2 column3
data data data
在从 csv 读取表格数据开始之前,我是否可以应用任何函数来删除任何行?目前column 上面的行在我读入时看起来像奇怪的字符。
新表应如下所示:
colum1 column2 column3
data data data
【问题讨论】:
-
您可以在阅读时跳过这些行。pandas.pydata.org/pandas-docs/stable/generated/…
-
无论如何我可以以编程方式跳过这些行吗?我有很多带有这类标题的文件,而不是固定长度的文件。
-
那么您要保留的第一行是否始终以
'column1'开头?还是您要跳过的标题的最后一行总是以'from:'结尾? -
@ALollz 这就是文档没有标准化的问题,所以我不知道标题或列名的结尾。我在想也许会有一个内置函数来检测表格数据列的开始位置
-
我认为没有完美的方法。根据我的经验,pandas 解析器将使用第 0 行(在 skiprows 之后)作为标题和标记数据的基础。您可以尝试让它自动找出您想要的内容,但例如,它将以
from: jane作为标题列很好地解析文件,这将使您的前两列成为多索引。如果您希望正确执行此操作而不会出现任何错误,您确实需要提出一些算法模式。
标签: python python-3.x pandas csv