【发布时间】:2019-04-26 16:31:12
【问题描述】:
我正在尝试运行一个 spark-streaming 应用程序,它从 kafka 流中读取数据并对其进行处理。我正在运行以下内容。
val schema = new StructType()
.add("InvoiceNo", LongType)
.add("StockCode", LongType)
.add("Description", StringType)
.add("Quantity", ShortType)
.add("InvoiceDate", StringType)
.add("UnitPrice", DoubleType)
.add("CustomerID", IntegerType)
.add("Country", StringType)
val df = spark.readStream.
format("kafka").
option("kafka.bootstrap.servers", conf.get("spark.kafka_bootstrap_servers")).
option("subscribe", "webserver").
option("kafka.security.protocol", "SASL_SSL").
option("kafka.sasl.mechanism", "PLAIN").
option("kafka.ssl.protocol", "TLSv1.2").
option("kafka.ssl.enabled.protocols", "TLSv1.2").
option("failOnDataLoss", "false").
load()
我收到以下错误。
Exception in thread "main" org.apache.spark.sql.streaming.StreamingQueryException: CSV data source does not support binary data type.
我在流中给出的 csv 是
536365,85123A,WHITE HANGING HEART T-LIGHT HOLDER,6,01/12/10 8:26,2.55,17850,United Kingdom
此错误的原因可能是什么?
【问题讨论】:
标签: csv apache-spark apache-kafka apache-spark-sql spark-structured-streaming