【问题标题】:CSV file Infinity value issue with AWS Glue jobAWS Glue 作业的 CSV 文件无限值问题
【发布时间】:2022-01-30 12:15:31
【问题描述】:

我有一个 csv 文件,我正在使用 Pandas 读取它并尝试将 NaN 和 Infinity 转换为 0.0。我有在本地运行并正确转换的代码,例如:

df = pd.read_csv('test.csv')
print(df['C1'])
df.replace([np.inf, -np.inf], np.nan, inplace=True)
df = df.fillna(0.00)
print(df['C1'])
0    NaN
1    inf
2    NaN
Name: C1, dtype: float64
0    0.0
1    0.0
2    0.0
Name: C1, dtype: float64

在这里,无穷大和 NaN 值正确转换为 0.0,如输出所示。但是当我在 AWS Glue Python Shell 作业中执行相同操作时,它不会将无穷大值转换为 0.0。 Glue作业的代码和输出如下:

df = pd.read_csv('s3://bucket/test.csv')
print(df['C1'])
df = df.replace([np.Infinity, -np.Infinity], np.nan)
df = df.fillna(0.00)
print(df['C1'])
0         NaN
1    Infinity
2         NaN
Name: C1, dtype: object
0           0
1    Infinity
2           0
Name: C1, dtype: object

在本地和 S3 上使用相同的文件,但问题在于无穷大值。此外,在本地,数据类型被读取为 float64,但在 Glue 中为对象类型。有什么帮助吗?

【问题讨论】:

  • 看起来inf 是保留字而Infinity 不是(?),因此后者被视为字符串值。我认为诀窍不是替换 Infinityafter 它已经被读入,而是 while 读取文件,所以像pd.read_csv(.., na_values=["Infinity"] 这样的东西也见这个答案stackoverflow.com/a/68991060/1745616
  • 如果我按原样查看文件,则将 Infinity 写入值中。所以本地读取认为它是inf,但Glue代码将它读取为Infinity。
  • 这很有趣。我想知道 Pandas 和 Numpy 的本地和 Glue 运行时之间的版本差异是否会解释它?无论哪种方式,在 read_csv 期间使用dtype 参数转换它怎么样?即dtype={'C1': np.float64}
  • 鲍勃,有很多列,我认为不可能为每个列设置。

标签: python-3.x pandas numpy csv aws-glue


【解决方案1】:

我能够根据 cmets 中的 BdR 响应解决此问题,因此答案如下:

df = pd.read_csv(input_path, na_values=["Infinity", "-Infinity"])
df = df.replace([np.Infinity, -np.Infinity], np.nan)
df = df.fillna(0.00)

【讨论】:

  • 非常酷。感谢您分享您的发现!
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2019-11-05
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-05-01
  • 1970-01-01
相关资源
最近更新 更多