【问题标题】:Trouble With Pyspark Round FunctionPyspark 轮函数的问题
【发布时间】:2018-04-13 07:07:06
【问题描述】:

在 pyspark 中让 round 函数工作时遇到了一些麻烦 - 我有下面的代码块,我试图将 new_bid 列四舍五入到小数点后 2 位,然后将该列重命名为 bid -我正在导入pyspark.sql.functions AS func 以供参考,并使用其中包含的round 函数:

output = output.select(col("ad").alias("ad_id"),
                       col("part").alias("part_id"),
                       func.round(col("new_bid"), 2).alias("bid"))

这里的new_bid 列是浮点类型 - 生成的数据帧没有像我尝试的那样将新命名的bid 列四舍五入到小数点后 2 位,而它仍然是小数点后 8 位或 9 位。

我尝试了各种方法,但似乎无法让结果数据框具有舍入值 - 任何指针都将不胜感激!谢谢!

【问题讨论】:

    标签: apache-spark pyspark apache-spark-sql spark-dataframe pyspark-sql


    【解决方案1】:

    这里有几种方法可以处理一些玩具数据:

    spark.version
    # u'2.2.0'
    
    import pyspark.sql.functions as func
    
    df = spark.createDataFrame(
            [(0.0, 0.2, 3.45631),
             (0.4, 1.4, 2.82945),
             (0.5, 1.9, 7.76261),
             (0.6, 0.9, 2.76790),
             (1.2, 1.0, 9.87984)],
             ["col1", "col2", "col3"])
    
    df.show()
    # +----+----+-------+ 
    # |col1|col2|   col3|
    # +----+----+-------+
    # | 0.0| 0.2|3.45631| 
    # | 0.4| 1.4|2.82945|
    # | 0.5| 1.9|7.76261| 
    # | 0.6| 0.9| 2.7679| 
    # | 1.2| 1.0|9.87984| 
    # +----+----+-------+
    
    # round 'col3' in a new column:
    df2 = df.withColumn("col4", func.round(df["col3"], 2)).withColumnRenamed("col4","new_col3")
    df2.show()
    # +----+----+-------+--------+ 
    # |col1|col2|   col3|new_col3|
    # +----+----+-------+--------+
    # | 0.0| 0.2|3.45631|    3.46|
    # | 0.4| 1.4|2.82945|    2.83|
    # | 0.5| 1.9|7.76261|    7.76|
    # | 0.6| 0.9| 2.7679|    2.77|
    # | 1.2| 1.0|9.87984|    9.88|
    # +----+----+-------+--------+
    
    # round & replace existing 'col3':
    df3 = df.withColumn("col3", func.round(df["col3"], 2))
    df3.show()
    # +----+----+----+ 
    # |col1|col2|col3| 
    # +----+----+----+ 
    # | 0.0| 0.2|3.46| 
    # | 0.4| 1.4|2.83| 
    # | 0.5| 1.9|7.76| 
    # | 0.6| 0.9|2.77| 
    # | 1.2| 1.0|9.88| 
    # +----+----+----+ 
    

    这是个人喜好,但我不是colalias 的忠实粉丝——我更喜欢withColumnwithColumnRenamed。不过,如果您想坚持使用selectcol,您应该如何调整自己的代码 sn-p:

    from pyspark.sql.functions import col
    
    df4 = df.select(col("col1").alias("new_col1"), 
                    col("col2").alias("new_col2"), 
                    func.round(df["col3"],2).alias("new_col3"))
    df4.show()
    # +--------+--------+--------+ 
    # |new_col1|new_col2|new_col3| 
    # +--------+--------+--------+
    # |     0.0|     0.2|    3.46|
    # |     0.4|     1.4|    2.83|
    # |     0.5|     1.9|    7.76|
    # |     0.6|     0.9|    2.77|
    # |     1.2|     1.0|    9.88|
    # +--------+--------+--------+
    

    【讨论】:

      猜你喜欢
      • 2023-02-23
      • 1970-01-01
      • 1970-01-01
      • 2020-12-05
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-12-06
      • 1970-01-01
      相关资源
      最近更新 更多