【发布时间】:2021-03-24 14:05:08
【问题描述】:
我正在尝试在 Spark 数据帧中读取编码为 UTF-16 的文件。但是,当我显示我的数据框的结果时,我的结果集中出现了不需要的特殊字符。
我尝试了以下方法 - 使用 UTF-16BE:
df = spark.read.format('text').option("encoding", 'UTF-16BE').option("charset", 'UTF-16').option('delimiter', "\|").option('header', 'false').option("quote", "\"").option("escape", "\"").load(filepath)
并使用 UTF-16LE 尝试了以下操作:
df = spark.read.format('text').option("encoding", 'UTF-16LE').option("charset", 'UTF-16').option('delimiter', "\|").option('header', 'false').option("quote", "\"").option("escape", "\"").load(filepath)
两次尝试都返回不需要的特殊字符。
非常感谢任何帮助。
【问题讨论】:
标签: python pyspark apache-spark-sql azure-databricks utf-16