【问题标题】:Pyspark: encoding chinese chararacters when saving dataframe as csv filePyspark:将数据帧保存为csv文件时编码中文字符
【发布时间】:2018-08-01 13:48:09
【问题描述】:

我尝试使用此方法保存包含包含中文字母的列的数据框:

df.coalesce(1).write.option("header", "true").csv(r'path\...\file.csv')

但是输出包含奇怪的字符而不是中文字母。

【问题讨论】:

    标签: csv encoding pyspark unicode-string


    【解决方案1】:

    尝试使用 UTF-8 对其进行编码,并确保使用适当的编码读取文本文件:

    df.coalesce(1).write.option("header", "true").option("encoding", "UTF-8").csv(r'path\....\file.csv')
    

    【讨论】:

    • 输出仍然包含奇怪的字符(é«∼峰专线104è·¯)
    • 您确定它不是来自您的文本编辑器并且您正在使用 UTF-8 格式读取文件吗?
    • 我也是说 UTF-8,但它可能是不同的编码。事先检查输入的编码。
    猜你喜欢
    • 1970-01-01
    • 2019-11-07
    • 1970-01-01
    • 1970-01-01
    • 2021-01-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多