【发布时间】:2015-06-05 12:01:32
【问题描述】:
我对 Apache Spark 的世界还比较陌生。我正在尝试使用 LinearRegressionWithSGD() 估计一个大型模型,我想在其中估计固定效应和交互项,而不必创建巨大的设计矩阵。
我注意到决策树中有一个支持分类变量的实现
创建从字符串到整数的哈希映射并将其提供给模型。有人在 Spark 中尝试过类似的线性模型练习吗?
谢谢。
【问题讨论】:
-
您找到解决方案了吗?我有一个分类变量的文档,我想将其转换为向量。我尝试使用 HashingTF 解决它。我将该行作为 Iterable[String] 传递给 hashingTf,它给了我一个向量,我用它来创建一个标记点。它有效,但不确定这是否是正确的方法。我认为正确的解决方案是为每个单词分配一个数字,然后我们使用该数字创建一个向量。我猜 IDF 会这样做,但我在训练期间没有完整的词汇表。
标签: scala apache-spark apache-spark-mllib