【发布时间】:2021-07-15 00:54:08
【问题描述】:
我正在尝试使用无法编辑的 Excel 电子表格构建机器学习模型。 .xls 中的一些列存在格式问题,因此某些数据显示为日期时间戳,而不是 str 或 int。以下是 pd 数据框的示例:
0 40-49 premeno 15-19 0-2 yes 3
1 50-59 ge40 15-19 0-2 no 1
2 50-59 ge40 35-39 0-2 no 2
3 40-49 premeno 35-39 0-2 yes 3
4 40-49 premeno 30-34 **2019-05-03 00:00:00** yes 2
在第 4 行中,3-5 的值被意外格式化为日期(在 xls 中显示为 03 May),因此被指定为数据框中的日期时间戳。我尝试了很多方法将2019-05-03 00:00:00 替换为3-5,包括:
df['column'] = df['column'].replace([('2019-05-03 00:00:00')], '3-5')
并使用 Timestamp.replace 但似乎都不起作用。关于如何用正确的数据替换这些格式错误的数据点有什么想法吗?
【问题讨论】:
-
防止 Excel 在这里变得聪明的一个助手是指定单元格的内容,如
="3-5"或预先将单元格的类型更改为“文本”。
标签: python excel pandas dataframe datetime