【发布时间】:2011-12-19 23:37:11
【问题描述】:
我希望将我们的各种机器学习算法的本土平台从 C# 移植到更强大的数据挖掘平台,例如 R。虽然很明显 R 非常适合多种类型的数据挖掘任务,但目前还不清楚对我来说,如果它可以用于文本分类。
具体来说,我们从文本中提取一个二元组列表,然后将其分类为 15 个不同类别之一,例如:
Bigram 清单:珠宝、书籍、手表、鞋子、百货商店 -> 类别:购物
我们既想在 R 中训练模型,又想连接到数据库以更大规模地执行此操作。
可以在 R 中完成吗?
【问题讨论】:
-
您可能会对这篇论文感兴趣。 jstatsoft.org/v25/i05/paper
-
你能澄清你的问题吗?标题提到了一种通用方法,而问题的文本并没有特别提供有关您尝试调查的模型的信息。答案是肯定的,R可以用于文本分类。请详细说明您的目标。
-
当然可以。我们想要解决许多不同类型的分类问题,但一个简单的例子是加载一组文档并将它们分配到 15 个不同类别中的一个。根据所选择的算法,文档可能会被预处理成不同的形式,例如 A) 一个简单的文本文件 B) 一袋一元 C) 一袋二元组等。似乎一个二元表上的 GIS 方法会效果很好,但分类树似乎也是一个很有前途的候选者。
标签: r data-mining text-mining