【问题标题】:Read simple csv with PySpark使用 PySpark 读取简单的 csv
【发布时间】:2020-07-02 15:22:24
【问题描述】:

可能是一个愚蠢的问题,但我不明白。我正在使用 Python3.6、Spark 2.4 开发 Jupyter Notebook,由 IBM Watson Studio 托管。

我有一个简单的 csv 文件:

num,label
0,0
1,0
2,0
3,0

为了阅读它,我使用以下命令:

labels = spark.read.csv(url, sep=',', header=True)

但是如果我检查labels 是否正确,使用labels.head(),我会得到Row(PAR1Љ��L�Q�� ='\x08\x00]')

我错过了什么?

【问题讨论】:

    标签: csv pyspark data-science-experience


    【解决方案1】:

    这似乎是由于编码问题

    尝试使用选项中提供的编码,也尝试使用 UTF-8

    labels = spark.read.csv(url, sep=',', header=True).option("encoding", "ISO-8859-1")
    

    【讨论】:

    • 确实 ISO-8859-1 编码完成了这项工作。但是,这样说是行不通的。我跑了labels = spark.read.csv(url, sep=',', header=True, encoding="ISO-8859-1")
    猜你喜欢
    • 2022-01-03
    • 2021-05-22
    • 1970-01-01
    • 2016-10-22
    • 2020-04-30
    • 1970-01-01
    • 2018-07-17
    • 2018-10-23
    相关资源
    最近更新 更多