【发布时间】:2021-12-27 01:21:04
【问题描述】:
我有一个巨大的 CSV 文件,如下所示:
1. 02.01.18;"""2,871""";"""2,915""";"""2,871""";"""2,878""";"""+1,66 %""";"""57.554""";"""166.075 EUR""";"""0,044"""
2. 03.01.18;"""2,875""";"""2,965""";"""2,875""";"""2,925""";"""+1,63 %""";"""39.116""";"""114.441 EUR""";"""0,090"""
3. 04.01.18;"""2,915""";"""3,005""";"""2,915""";"""2,988""";"""+2,15 %""";"""58.570""";"""174.168 EUR""";"""0,090"""
最后我只想提取日期和比率。数据集应如下所示:
1.02.01.18, +1,66 %
2.03.01.18, +1,63 %
3.04.01.18, +2,15 %
我试过这个,直到现在我才遇到更多麻烦:
import pandas as pd
df = pd.read_csv("Dataset.csv", nrows=0)
print(df)
data = []
for response in df:
data.append(
response.split(';')
)
print(data[0])
您知道清理此数据集的更好方法吗?
【问题讨论】:
-
你真的有/需要行索引,即日期之前的值吗?
-
这是一个奇怪的文件。它在前两个字段之间有过多的引用和不一致的分隔符。老实说,如果您可以解决该文件的创建方式的问题。