【发布时间】:2015-07-16 20:57:49
【问题描述】:
我正在尝试读取大小约为 1.89Gb 的 .idx 文件。如果我写:
indexfile=pd.read_table("C:\Edgar Zip 文件\2001\company.idx")
我得到的输出为:
- 公司名称 表格类型 CIK 日期 归档文件名
- 0 033 资产管理有限责任公司 / ...
- 1 033 资产管理有限责任公司 / ...
- 2 1 800 联系公司 ...
- 3 1 800 联系公司 ...
- 4 1 800 FLOWERS COM INC ...
所有列都合并在一个列中
如果我这样做:
indexfile=pd.read_table("C:\Edgar Zip files\2001\company.idx",sep="")
我得到错误:
CParserError:标记数据时出错。 C 错误:预计第 4 行中有 69 个字段,看到 72
我可以使用:
indexfile=pd.read_table("C:\Edgar Zip files\2001\company.idx",error_bad_lines=False)
但这只会删除我的大部分数据。
有什么解决办法吗?
PS:链接到示例 .idf 文件 SEC EDGAR。下载 company.idx 文件。
【问题讨论】: