【发布时间】:2022-01-30 12:15:31
【问题描述】:
我有一个 csv 文件,我正在使用 Pandas 读取它并尝试将 NaN 和 Infinity 转换为 0.0。我有在本地运行并正确转换的代码,例如:
df = pd.read_csv('test.csv')
print(df['C1'])
df.replace([np.inf, -np.inf], np.nan, inplace=True)
df = df.fillna(0.00)
print(df['C1'])
0 NaN
1 inf
2 NaN
Name: C1, dtype: float64
0 0.0
1 0.0
2 0.0
Name: C1, dtype: float64
在这里,无穷大和 NaN 值正确转换为 0.0,如输出所示。但是当我在 AWS Glue Python Shell 作业中执行相同操作时,它不会将无穷大值转换为 0.0。 Glue作业的代码和输出如下:
df = pd.read_csv('s3://bucket/test.csv')
print(df['C1'])
df = df.replace([np.Infinity, -np.Infinity], np.nan)
df = df.fillna(0.00)
print(df['C1'])
0 NaN
1 Infinity
2 NaN
Name: C1, dtype: object
0 0
1 Infinity
2 0
Name: C1, dtype: object
在本地和 S3 上使用相同的文件,但问题在于无穷大值。此外,在本地,数据类型被读取为 float64,但在 Glue 中为对象类型。有什么帮助吗?
【问题讨论】:
-
看起来
inf是保留字而Infinity不是(?),因此后者被视为字符串值。我认为诀窍不是替换Infinity值 after 它已经被读入,而是 while 读取文件,所以像pd.read_csv(.., na_values=["Infinity"]这样的东西也见这个答案stackoverflow.com/a/68991060/1745616 -
如果我按原样查看文件,则将 Infinity 写入值中。所以本地读取认为它是inf,但Glue代码将它读取为Infinity。
-
这很有趣。我想知道 Pandas 和 Numpy 的本地和 Glue 运行时之间的版本差异是否会解释它?无论哪种方式,在 read_csv 期间使用
dtype参数转换它怎么样?即dtype={'C1': np.float64} -
鲍勃,有很多列,我认为不可能为每个列设置。
标签: python-3.x pandas numpy csv aws-glue