【问题标题】:In Apache Spark CSV we are giving the delimiter for field but how to give delimiter for row?在 Apache Spark CSV 中,我们为字段提供分隔符,但如何为行提供分隔符?
【发布时间】:2017-10-04 15:08:21
【问题描述】:

我们有不同类型的 CSV 文件,其中一些是用于行分隔符的换行符,其中一些是其他自定义分隔符,例如 |,!..etc 是行分隔符。那么如何在 spark CSV 数据读取中提供行分隔符。

【问题讨论】:

    标签: apache-spark


    【解决方案1】:

    在 Spark 2.0 中,您可以将分隔符作为选项传递。 示例:

    var options = new HashMap[String, String]()
    options += ("header" -> "true")
    options += ("delimiter" -> "\t")
    options += ("maxCharsPerColumn" -> "200")
    

    然后您可以传递选项并读取 csv:spark.read.format("csv").options(options).load("fileLocation")

    【讨论】:

    • 我使用了相同的数据集 csvDs = spark.read().format("CSV").option("header", "true").option("inferSchema", "true" ).option("分隔符", ",").load(model.getFilePath());此处代码使用字段分隔符作为默认行分隔符作为换行符(“\n”)可以正常工作。我的问题在这里,我们只有用于字段定界符的定界符我问的是行定界符,例如像这个 ID、名称|1、Srnu|2、Srnu Babu 这样的数据文件,这里的行定界符是 |
    猜你喜欢
    • 2011-11-09
    • 1970-01-01
    • 1970-01-01
    • 2016-07-15
    • 1970-01-01
    • 2019-12-22
    • 2015-11-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多