【发布时间】:2020-05-08 21:37:16
【问题描述】:
我需要一次读取多个 csv 文件。现在,这些 csv 文件可能具有可变数量的列并且以任何顺序排列。我们要求只读取 csv 文件中的特定列。我们如何做到这一点?我曾尝试定义自定义架构,但随后我在列中得到了不同的数据。
例如:
CSV 文件
ID、姓名、地址 如何仅选择 Id 和地址列。因为如果我说 select (Id, Address) 那么它会在 Address 列中给我 ID 和 Name 数据。我想在阅读时根据标题名称只选择 ID 和地址列。
谢谢, 导航
【问题讨论】:
标签: pyspark