【发布时间】:2019-03-22 08:57:18
【问题描述】:
我正在使用 SparkR 并尝试将“SparkDataFrame”转换为“事务”以挖掘项目/产品的关联。
我在此链接https://blog.aptitive.com/building-the-transactions-class-for-association-rule-mining-in-r-using-arules-and-apriori-c6be64268bc4 上找到了一个类似的示例,但这仅适用于您使用 R data.frame 的情况。我目前有这种格式的数据;
CUSTOMER_KEY_h PRODUCT_CODE
1 SAVE
1 CHEQ
1 LOAN
1 LOAN
1 CARD
1 SAVE
2 CHEQ
2 LOAN
2 CTSAV
2 SAVE
2 CHEQ
2 SAVE
2 CARD
2 CARD
3 LOAN
3 CTSAV
4 SAVE
5 CHEQ
5 SAVE
5 CARD
5 LOAN
5 CARD
6 CHEQ
6 CHEQ
并希望得到这样的结果;
CUSTOMER_KEY_h PRODUCT_CODE
1 {SAVE, CHEQ, LOAN, LOAN , CARD, SAVE}
2 {CHEQ, LOAN, CTSAV, SAVE, CHEQ, SAVE, CARD, CARD}
3 {LOAN, CTSAV}
4 {SAVE}
5 {CHEQ, SAVE, CARD, LOAN, CARD}
6 {CHEQ, CHEQ}
或者,如果我可以在 SparkR 中获得这个 R 脚本的等价物
df2 <- apply(df,2,as.logical) 这会很有帮助。
【问题讨论】:
标签: r apache-spark sparkr apriori arules