【问题标题】:Can I perform Generalized Iterative Scaling in R?我可以在 R 中执行广义迭代缩放吗?
【发布时间】:2011-12-19 23:37:11
【问题描述】:

我希望将我们的各种机器学习算法的本土平台从 C# 移植到更强大的数据挖掘平台,例如 R。虽然很明显 R 非常适合多种类型的数据挖掘任务,但目前还不清楚对我来说,如果它可以用于文本分类。

具体来说,我们从文本中提取一个二元组列表,然后将其分类为 15 个不同类别之一,例如:

Bigram 清单:珠宝、书籍、手表、鞋子、百货商店 -> 类别:购物

我们既想在 R 中训练模型,又想连接到数据库以更大规模地执行此操作。

可以在 R 中完成吗?

【问题讨论】:

  • 您可能会对这篇论文感兴趣。 jstatsoft.org/v25/i05/paper
  • 你能澄清你的问题吗?标题提到了一种通用方法,而问题的文本并没有特别提供有关您尝试调查的模型的信息。答案是肯定的,R可以用于文本分类。请详细说明您的目标。
  • 当然可以。我们想要解决许多不同类型的分类问题,但一个简单的例子是加载一组文档并将它们分配到 15 个不同类别中的一个。根据所选择的算法,文档可能会被预处理成不同的形式,例如 A) 一个简单的文本文件 B) 一袋一元 C) 一袋二元组等。似乎一个二元表上的 GIS 方法会效果很好,但分类树似乎也是一个很有前途的候选者。

标签: r data-mining text-mining


【解决方案1】:

嗯,我开始研究机器学习,但我可能有一个建议:你考虑过Weka 吗?周围有很多不同的算法,并且有一些文档。另外,还有一个使用 Weka jar 的 R 包RWeka

编辑: Witten 等人也有一篇不错的综合读物。 :Data mining,其中包含对 Weka 的广泛描述以及其他有趣的内容。研究 API 机会。

【讨论】:

  • 我们不使用 Java,但如果 R​​ 不起作用,可能需要考虑。
  • 无需深入了解 Java 即可尝试 RWeka。只需 install.packages("RWeka") 并浏览一下小插图就可以了。
  • 很好...我不知道。那我再研究一下!
猜你喜欢
  • 2016-11-21
  • 1970-01-01
  • 2011-11-29
  • 1970-01-01
  • 2011-12-22
  • 2011-08-13
  • 2022-11-17
  • 1970-01-01
  • 2012-06-04
相关资源
最近更新 更多