Pandas read_fwf：指定 dtype答案

【问题标题】：Pandas read_fwf: specify dtypePandas read_fwf：指定 dtype
【发布时间】：2016-04-19 21:01:22
【问题描述】：

我正在读取一个大块的固定宽度文本文件并将数据导出为 .csv。因为 pandas.read_fwf 不允许指定 dtypes，所以我是想知道还有什么其他方法可以强制列成为字符串。这原因是熊猫将某些列推断为浮动，即使它们不是，并且我不想在列中使用.0。

使用data[column] = data[column].astype(str) 无济于事，因为它不会得到摆脱小数。 将 float64 dtype 的列转换为 int 不起作用要么，因为 NA 无法转换。有什么想法吗？

这是我的代码的 sn-p：

dat = pd.read_fwf(file_to_read,colspecs=cols,header=None,chunksize=100000,names=header)
#First chunk
data.info()
Int64Index: 100000 entries, 0 to 99999
Columns: 562 entries,
dtypes: float64(405), int64(4), object(153)
memory usage: 429.5+ MB

for column in data.columns:
    if data[column].dtype == 'float64':
        data[column] = data[column].astype(int)
    else:
        pass

我可以做str().replace('.0','')，但我想找到一个比遍历需要大量时间的列。

【问题讨论】：

它确实支持 dtype 请查看文档pandas.pydata.org/pandas-docs/stable/generated/…

标签： python pandas dtype

【解决方案1】：

converter 参数可用于将数据保存为字符串，因为如果指定了转换器，pd.read_fwf 不会尝试猜测 dtype：

import pandas as pd
try:
    # for Python2
    from cStringIO import StringIO 
except ImportError:
    # for Python3
    from io import StringIO

content = '''\
1.0    2    A
3.0    4    B
5      X    C
M      Y    D
'''
header = ['foo', 'bar', 'baz']

for df in pd.read_fwf(StringIO(content), header=None, chunksize=2, names=header,
                      converters={h:str for h in header}):
    print(df)
df.info()

产量

   foo bar baz
0  1.0   2   A
1  3.0   4   B

  foo bar baz
0   5   X   C
1   M   Y   D

<class 'pandas.core.frame.DataFrame'>
RangeIndex: 2 entries, 0 to 1
Data columns (total 3 columns):
foo    2 non-null object
bar    2 non-null object
baz    2 non-null object
dtypes: object(3)
memory usage: 120.0+ bytes

【讨论】：

感谢您展示示例！它完美地工作。我完全忽略了转换器选项...