【问题标题】:Read error with spark.read against SQL Server table (via JDBC Connection)spark.read 对 SQL Server 表的读取错误(通过 JDBC 连接)
【发布时间】:2020-02-19 11:49:46
【问题描述】:

当我尝试创建直接从 SQL 表读取的数据框时,我在 Zeppelin 中遇到了问题。问题是我不知道如何读取地理类型的 SQL 列。

SQL table

这是我正在使用的代码,以及我得到的错误。

创建 JDBC 连接

import org.apache.spark.sql.SaveMode
import java.util.Properties

val jdbcHostname = "XX.XX.XX.XX"
val jdbcDatabase = "databasename"
val jdbcUsername = "user"
val jdbcPassword = "XXXXXXXX"

// Create the JDBC URL without passing in the user and password parameters.
val jdbcUrl = s"jdbc:sqlserver://${jdbcHostname};database=${jdbcDatabase}"

// Create a Properties() object to hold the parameters.
val connectionProperties = new Properties()
connectionProperties.put("user", s"${jdbcUsername}")
connectionProperties.put("password", s"${jdbcPassword}")
connectionProperties.setProperty("Driver", "com.microsoft.sqlserver.jdbc.SQLServerDriver")

从 SQL 读取

import spark.implicits._

val table = "tablename"

val postcode_polygons = spark.
    read.
    jdbc(jdbcUrl, table, connectionProperties)

错误

import spark.implicits._
table: String = Lookup.Postcode50m_Lookup
java.sql.SQLException: Unsupported type -158
  at org.apache.spark.sql.execution.datasources.jdbc.JdbcUtils$.org$apache$spark$sql$execution$datasources$jdbc$JdbcUtils$$getCatalystType(JdbcUtils.scala:233)
  at org.apache.spark.sql.execution.datasources.jdbc.JdbcUtils$$anonfun$8.apply(JdbcUtils.scala:290)
  at org.apache.spark.sql.execution.datasources.jdbc.JdbcUtils$$anonfun$8.apply(JdbcUtils.scala:290)
  at scala.Option.getOrElse(Option.scala:121)
  at org.apache.spark.sql.execution.datasources.jdbc.JdbcUtils$.getSchema(JdbcUtils.scala:289)
  at org.apache.spark.sql.execution.datasources.jdbc.JDBCRDD$.resolveTable(JDBCRDD.scala:64)
  at org.apache.spark.sql.execution.datasources.jdbc.JDBCRelation.<init>(JDBCRelation.scala:114)
  at org.apache.spark.sql.execution.datasources.jdbc.JdbcRelationProvider.createRelation(JdbcRelationProvider.scala:52)
  at org.apache.spark.sql.execution.datasources.DataSource.resolveRelation(DataSource.scala:307)
  at org.apache.spark.sql.DataFrameReader.load(DataFrameReader.scala:178)
  at org.apache.spark.sql.DataFrameReader.load(DataFrameReader.scala:146)
  at org.apache.spark.sql.DataFrameReader.jdbc(DataFrameReader.scala:193)

【问题讨论】:

  • 不支持的列类型或无效的表类型等?
  • 我之前使用过代码来读取其他表格,所以,我认为问题不在于表格或代码,而在于地理类型的列。
  • 我想你已经回答了自己的问题

标签: sql-server apache-spark apache-zeppelin


【解决方案1】:

添加到 bluephantom 答案您是否尝试将类型更改为字符串,如下所示并加载表格。

val jdbcDF = spark.read.format("jdbc")
  .option("dbtable" -> "(select toString(SData) as s_sdata,toString(CentroidSData) as s_centroidSdata from table) t")
  .option("user", "user_name")
  .option("other options")
  .load()

【讨论】:

    【解决方案2】:

    这是我的最终解决方案,moasifk 的想法是正确的,但在我的代码中我不能使用函数“toString”。我应用了相同的想法,但使用了另一个 sintaxis。

    import spark.implicits._
    
    val tablename = "Lookup.Postcode50m_Lookup"
    
    val postcode_polygons = spark.
        read.
        jdbc(jdbcUrl, table=s"(select PostcodeNoSpaces, cast(SData as nvarchar(4000)) as SData from $tablename) as postcode_table", connectionProperties)
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-01-02
      • 1970-01-01
      • 1970-01-01
      • 2020-05-11
      • 1970-01-01
      相关资源
      最近更新 更多