【发布时间】:2019-03-30 20:28:52
【问题描述】:
我需要处理整个 2018 年每 20 秒测量一次的数据,原始文件具有以下结构:
约会时间很多垃圾
在几行
样本量再次被丢弃
数据
约会时间很多垃圾
等等
我想为它制作一个 pandas 数据帧或每个数据块(其大小编码为样本量)至少一个数据帧,以节省测量时间。
如何忽略所有其他数据垃圾?我知道它是定期编写的(周期 = 样本数量),但是: - 我不知道文件中有多少个字符串 - 我不想在循环中使用显式方法 file.getline(),因为它会无休止地工作(尤其是在 python 中)而且我没有足够的计算能力来使用它
是否有任何方法可以在 pandas 或其他库中定期跳过行?或者我还能怎么解决?
我的数据有一个例子:
https://drive.google.com/file/d/1OefLwpTaytL7L3WFqtnxg0mDXAljc56p/view?usp=sharing
我想获得类似于图片上的数据表的数据框 + 带有日期时间的附加列,没有技术行
【问题讨论】:
-
你看过documentation中的
skiprows参数吗? -
我有,你必须有索引列表才能跳过才能使用它,而知道这一切的唯一方法就是循环计数,什么意思(因为我不知道如何计数行而不阅读它们,这个问题也在这里)我需要用 file.getline() 读取我的所有数据我错过了 smt 吗?
-
我和 RafealC 是否正确理解了您的问题?
-
哦,不确定,我再试一次:我需要跳过 5 行,读取 56,跳过 5 等等。由于数据的大小,我不能在一个循环中逐行读取,而且我不知道如何获取有关文件中有多少行的信息。是不是更清楚了?