【发布时间】:2018-04-23 13:58:00
【问题描述】:
我的一个输入文件是 csv(用逗号分隔)。其中一个字段是地址,其中包含换行符。因此,当我使用 spark 读取它时,这给我带来了相当大的麻烦,其中一个输入记录被拆分为多个记录。
有没有人能够找到解决这个问题的方法。目前做的解决方法是在读入spark之前,在source端去掉data中的换行符。
我想在 spark 中为此创建一个通用解决方案。我使用 scala 数据框 api。
【问题讨论】:
标签: scala csv spark-dataframe