【问题标题】:error UnicodeDecodeError: 'utf-8' codec when reading CSV错误 UnicodeDecodeError:读取 CSV 时出现“utf-8”编解码器
【发布时间】:2019-03-05 04:09:39
【问题描述】:

我最近从 PISA 下载了 PISA 2012 学生数据库。我按照说明在 SAS 上成功阅读。然后我导出为 CSV 以使用 proc 导出在 Python 3 中读取它,但是在尝试在 python pandas 中读取它时我不断收到此错误:UnicodeDecodeError: 'utf-8' codec can't decode byte 0xc1 in position 24: invalid起始字节。我能做什么?

pisa2012_Col=pd.read_csv('Pisasubset2012Col.csv')

【问题讨论】:

    标签: python-3.x


    【解决方案1】:

    尝试使用

    pisa2012_Col=pd.read_csv('Pisasubset2012Col.csv', encoding = "ISO-8859-1")
    

    由于read_csv 有一个编码选项来处理不同格式的文件(参见python docs)

    【讨论】:

    • 为什么你认为文件是用 ISO-8859-1 编码的?
    • 该文件肯定包含错误编码的数据。从错误消息中的 0xc1 开始,我认为 Latin_1 将在这里完成工作。 ISO-8859-1 或 Latin_1 是 8 位字符集,因此所有垃圾都有一个有效值。
    【解决方案2】:

    谢谢你们。它似乎工作。我成功地阅读了它,直到知道,变量对我的计算反应良好。似乎解决了。

    【讨论】:

      猜你喜欢
      • 2016-02-22
      • 1970-01-01
      • 1970-01-01
      • 2017-11-08
      • 2014-08-29
      • 1970-01-01
      • 2016-08-21
      • 1970-01-01
      相关资源
      最近更新 更多