【发布时间】:2014-12-23 03:15:23
【问题描述】:
我希望对使用pd.read_excel() 创建的以下记录(当前显示为 3.200000e+18 但实际上(希望)每个都是不同的长整数)进行不同的解释:
ipdb> self.after['class_parent_ref']
class_id
3200000000000515954 3.200000e+18
3200000000000515951 NaN
3200000000000515952 NaN
3200000000000515953 NaN
3200000000000515955 3.200000e+18
3200000000000515956 3.200000e+18
Name: class_parent_ref, dtype: float64
目前,它们似乎以科学标记字符串的形式“出现”:
ipdb> self.after['class_parent_ref'].iloc[0]
3.2000000000005161e+18
不过,更糟糕的是,我不清楚是否从我的 .xlsx 文件中正确读取了该数字:
ipdb> self.after['class_parent_ref'].iloc[0] -3.2e+18
516096.0
Excel(数据源)中的数字是3200000000000515952。
这与显示无关,我知道我可以更改 here。这是关于将基础数据保持在读取时的相同形式(这样如果/当我将其写回 Excel 时,它看起来会相同,因此如果我使用数据,它看起来就像在 Excel 中而不是 Xe+Y 中)。如果我可以指望它是正确数字的字符串表示,我肯定会接受一个字符串。
您可能会注意到,我想要看到的数字实际上是(顺便说一句)标签之一。 Pandas 正确地将它们读取为字符串(可能是因为 Excel 将它们视为字符串?)与我输入的这个数字不同。 (实际上,即使我在重读之前在有问题的单元格中输入 ="3200000000000515952" 时,我也会得到与上述相同的结果。)
如何从数据框中获取 3200000000000515952?我想知道 pandas 是否对长整数有限制,但 the only thing I've found on it 是 1)有点过时,2)看起来不像我面临的同一件事。
谢谢!
【问题讨论】:
-
问题是你有浮点数,而不是整数。并且您拥有的数字太大而无法具有浮点数这样的精度。您最终使用浮点数的原因是因为
NaN值(整数列不支持NaN,因此它被转换为浮点数)。 -
谢谢,@joris。使用 read_excel() 的 keep_default_na=False kwarg 似乎已经解决了这个问题。请随意回答,我会“检查”它。
-
@HaPsantran 您可能只想提供自己的答案,因为 joris 似乎没有注意到您的建议。
标签: python pandas long-integer