【发布时间】:2022-10-06 05:07:30
【问题描述】:
我正在使用以下代码读取 PySpark 中的 CSV 文件
cb_sdf = sqlContext.read.format(\"csv\") \\
.options(header=\'true\',
multiLine = \'True\',
inferschema=\'true\',
treatEmptyValuesAsNulls=\'true\') \\
.load(cb_file)
行数是正确的。但是对于某些行,列的分隔不正确。我认为是因为当前的分隔符是\",\",但是有些单元格在文本中也包含\", \"。
例如,pandas 数据框中的以下行(我使用 pd.read_csv 进行调试)
| name | industry | country | 111 | package/freight delivery | russia |
|
|---|