【问题标题】:Matrix Multiplication in Apache Spark [closed]Apache Spark 中的矩阵乘法 [关闭]
【发布时间】:2016-04-18 13:13:11
【问题描述】:

我正在尝试使用 Apache Spark 和 Java 执行矩阵乘法。

我有两个主要问题:

  1. 如何在 Apache Spark 中创建可以表示矩阵的 RDD?
  2. 如何将两个这样的 RDD 相乘?

【问题讨论】:

    标签: java scala apache-spark rdd apache-spark-mllib


    【解决方案1】:

    一切都取决于输入数据和维度,但一般来说,您想要的不是RDD,而是来自org.apache.spark.mllib.linalg.distributed 的分布式数据结构之一。目前它提供了DistributedMatrix的四种不同实现方式

    • IndexedRowMatrix - 可以直接从RDD[IndexedRow] 创建,其中IndexedRow 由行索引和org.apache.spark.mllib.linalg.Vector 组成

      import org.apache.spark.mllib.linalg.{Vectors, Matrices}
      import org.apache.spark.mllib.linalg.distributed.{IndexedRowMatrix,
        IndexedRow}
      
      val rows =  sc.parallelize(Seq(
        (0L, Array(1.0, 0.0, 0.0)),
        (0L, Array(0.0, 1.0, 0.0)),
        (0L, Array(0.0, 0.0, 1.0)))
      ).map{case (i, xs) => IndexedRow(i, Vectors.dense(xs))}
      
      val indexedRowMatrix = new IndexedRowMatrix(rows)
      
    • RowMatrix - 类似于IndexedRowMatrix,但没有有意义的行索引。可以直接从RDD[org.apache.spark.mllib.linalg.Vector]创建

      import org.apache.spark.mllib.linalg.distributed.RowMatrix
      
      val rowMatrix = new RowMatrix(rows.map(_.vector))      
      
    • BlockMatrix - 可以从 RDD[((Int, Int), Matrix)] 创建,其中元组的第一个元素包含块的坐标,第二个元素是本地 org.apache.spark.mllib.linalg.Matrix

      val eye = Matrices.sparse(
        3, 3, Array(0, 1, 2, 3), Array(0, 1, 2), Array(1, 1, 1))
      
      val blocks = sc.parallelize(Seq(
         ((0, 0), eye), ((1, 1), eye), ((2, 2), eye)))
      
      val blockMatrix = new BlockMatrix(blocks, 3, 3, 9, 9)
      
    • CoordinateMatrix - 可以从RDD[MatrixEntry] 创建,其中MatrixEntry 由行、列和值组成。

      import org.apache.spark.mllib.linalg.distributed.{CoordinateMatrix,
        MatrixEntry}
      
      val entries = sc.parallelize(Seq(
         (0, 0, 3.0), (2, 0, -5.0), (3, 2, 1.0),
         (4, 1, 6.0), (6, 2, 2.0), (8, 1, 4.0))
      ).map{case (i, j, v) => MatrixEntry(i, j, v)}
      
      val coordinateMatrix = new CoordinateMatrix(entries, 9, 3)
      

    前两个实现支持乘以本地 Matrix

    val localMatrix = Matrices.dense(3, 2, Array(1.0, 2.0, 3.0, 4.0, 5.0, 6.0))
    
    indexedRowMatrix.multiply(localMatrix).rows.collect
    // Array(IndexedRow(0,[1.0,4.0]), IndexedRow(0,[2.0,5.0]),
    //   IndexedRow(0,[3.0,6.0]))
    

    并且第三个可以乘以另一个BlockMatrix,只要此矩阵中每个块的列数与另一个矩阵的每个块的行数匹配。 CoordinateMatrix 不支持乘法,但很容易创建和转换为其他类型的分布式矩阵:

    blockMatrix.multiply(coordinateMatrix.toBlockMatrix(3, 3))
    

    每种类型都有自己的优势和劣势,当您使用稀疏或密集元素(Vectors 或块Matrices)时,还需要考虑一些额外的因素。乘以局部矩阵通常更可取,因为它不需要昂贵的改组。

    您可以在the MLlib Data Types guide 中找到有关每种类型的更多详细信息。

    【讨论】:

    • 这是关于如何创建不同矩阵类型的一个很好的总结——我想我要收藏它!
    • BlockMatrix 参数有什么用?我还看到 multiply 可以带一个 int 参数?我在尝试将 250k x 30k X 30k x 30k 相乘时遇到问题
    • 这是一个问题,即使您可以在 spark 中进行矩阵乘法,对吗?似乎 C 世界中的许多其他库在矩阵乘法方面做得更好,例如在深度学习库等中。在某些情况下,他们甚至利用分布式 GPU 处理。 spark中的矩阵运算效率低多少?
    • 我发现这非常有用。关闭此问题的用户是在做坏事。
    • 我想知道哪个更适合扩展,例如,如果您将它用于columnSimilarities
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-10-12
    • 2020-12-05
    相关资源
    最近更新 更多