【发布时间】:2018-05-17 09:48:03
【问题描述】:
我有一个 csv 文件,其中的行如下所示: 87.89,"2,392.05",14.77,373.2(第三行有千位分隔符)
pandas 一直将第二列中的逗号视为行分隔符并显示“错误标记数据”错误。
pandas 中是否可以忽略双引号之间的逗号? 谢谢
示例行:
9999992613813558569,87.89,"2,392.05",14.77,373.2
9999987064038821584,95.11,"3,397.04",42.15,"1,461.14"
9999956300203713283,6.67,194.02,41.23,"1,105.45"
9999946809576027532,15.08,353.84,29.43,591.9
编辑:
我已经试过了:
read_csv(file, quotechar='"', encoding='latin1', thousands=',')
read_csv(file, quotechar='"', encoding='latin1', escapechar ='"')
【问题讨论】:
-
好吧,当我对您的数据执行
read_csv()时,它会忽略双引号之间的逗号。为什么它不适合您! -
@AbdullahAhmedGhaznavi 你在用什么论据?
-
没有任何争论我只是在做
pd.read_csv('sample.csv') -
@AbdullahAhmedGhaznavi 我在上面的行中进行了尝试,效果很好。但由于某种原因,pandas 无法处理整个文件。
-
然后检查您的数据,似乎在某些行上您的列比其他行多!或者有可能在某些行上没有
" "标记正确检查您的数据!