【问题标题】:Popular Items suggestion - Time Sensitive Data - Data Mining热门商品建议 - 时间敏感数据 - 数据挖掘
【发布时间】:2012-11-15 03:13:03
【问题描述】:

我是数据挖掘领域的新手。我正在研究非常有趣的 Data Minign 问题。数据说明如下:

数据是时间敏感的。项目属性取决于时间因素及其类别标签。我将每周数据分组为训练或测试记录的一个实例。每周,一些项目属性可能会随着它的受欢迎程度(即类标签)而改变。

部分示例数据如下:

IsBestPicture,MovieID,YearOfRelease,WeekYear,IsBestDirector,IsBestActor,IsBestAc‌​tress,NumberOfNominations,NumberOfAwards,..,Label
-------------------------------------------------
0_1,60000161,2000,1,9-00,0,0,0,0,0,0,0
0_1,60004480,2001,22,19-02,1,0,0,11,3,0,0
0_1,60000161,2000,5,13-00,0,0,0,0,0,0,1
0_1,60000161,2000,6,14-00,0,0,0,0,0,0,0
0_1,60000161,2000,11,19-00,0,0,0,0,0,0,1

我的研究顾问建议使用朴素贝叶斯算法,它可以适应这种随时间变化的动态数据。

我使用 2000-2004 年的数据作为训练,2005 年作为测试。如果我在我的项目数据集中包含 Week-Year 属性,那么它将导致朴素贝叶斯的概率为 0。按时间顺序组织数据后,可以从我的数据集中省略此属性吗?

此外,当我阅读新的测试用例时,如何调整我的模型?因为新的测试用例可能会导致类标签的变化?

【问题讨论】:

标签: machine-learning data-mining time-series classification prediction


【解决方案1】:

您能否提供更多关于您的方法的见解?例如,您使用的是 R、SPSS、Python、SQL Server 2008R2 还是 RapidMiner 5.2?如果您可以将一些数据中的一小部分(3-4 行)包含在内,这将有助于人们弄清楚如何解决这个问题。

了解您正在查看的内容的一种直接方法是进行随机森林/决策树和 K-Means 聚类,以确定数据中的常见分离点。您是否开始快速浏览数据的直方图、平均值和异常值?

【讨论】:

  • 0_1,60000161,2000,1,9-00,0,0,0,0,0,0,0
    0_1,60004480,2001,22,19-02,1, 0,0,11,3,0,0
    0_1,60000161,2000,5,13-00,0,0,0,0,0,0,1
    0_1,60000161,2000,6, 14-00,0,0,0,0,0,0,0
    0_1,60000161,2000,11,19-00,0,0,0,0,0,0,1
  • IsBestPicture,MovieID,YearOfRelease,WeekYear,IsBestDirector,IsBestActor,IsBestActress,NumberOfNominations,NumberOfAwards,..,Label
  • 如果您可以看一下如何将代码加载到 cmets 中,那将更清晰,更容易理解您的原始数据转储。通常,您会编辑您的问题,然后通过在问题正文中放置四个空格来缩进代码。
猜你喜欢
  • 1970-01-01
  • 2011-02-07
  • 1970-01-01
  • 2023-03-20
  • 2015-11-14
  • 1970-01-01
  • 2019-12-23
  • 2016-03-17
  • 2019-04-24
相关资源
最近更新 更多