【发布时间】:2016-08-05 04:04:50
【问题描述】:
我有一个大文本文件,其中的列格式如下:
1255 32627 some random stuff which might have numbers 1245
1.我想用read_csv 给我一个三列的数据框。前两列应该是 dtype uint32,第三列只是后面的所有内容都在一个字符串中。也就是上面那行应该分成1255、32627和some random stuff which might have numbers 1245。例如,这不会这样做,但至少显示了 dtypes:
pd.read_csv("foo.txt", sep=' ', header=None, dtype={0:np.uint32, 1:np.uint32, 2:np.str})
2.我的第二个问题是关于str dtype。它使用多少内存,如果我知道字符串的最大长度,我可以减少它吗?
【问题讨论】: