【发布时间】:2017-11-28 17:57:49
【问题描述】:
我正在尝试为项目生成数据。数据需要从预定义的列表中随机生成。本质上,我有真实的数据,但它非常小。为了构建一些分类器(决策树、支持向量机和朴素贝叶斯),我想产生 100,000 次观察。
我是编码新手(我可以在 Matlab 和 R 中做一些基本的事情)并且最初尝试在 Excel 中执行此操作,但是,RANDOMA 函数生成了非常均匀分布的数据。更具体地说,我使用 5 个人口统计信息来预测客户将选择哪个零售商,例如零售商 A、B 或 C。人口统计信息列表如下:
1) 年龄组(18-24、25-34、35-44、45-54、55+) 2) 性别(男性或女性) 3) 收入组(
当我尝试随机创建 100,000 个观察值(每个观察值从 5 个列表中的每一个中随机选择 1 个)时,它们几乎均匀分布在它们之间。更糟糕的是,我随机分配给零售商(A、B 或 C)的值也是相等的。
想法是将这些随机生成的数据拆分为训练和测试数据,这样我就可以构建一些模型并测试它们的适用性。
【问题讨论】:
-
“他们之间平均分配”是什么意思?您的意思是每个列表中的选项以相同的频率出现(即 18-24 的数量与 25-34、35-44 等的数量大致相同)?如果您对每个列表进行统一抽样,那将是意料之中的。
-
请阅读Under what circumstances may I add “urgent” or other similar phrases to my question, in order to obtain faster answers? - 总结是这不是解决志愿者的理想方式,并且可能会适得其反。请不要将此添加到您的问题中。
-
随机增加样本量是一件可怕的事情——例如见stats.stackexchange.com/questions/13456/…。只需使用随机森林作为分类器 - 它以 bagging 为中心,非常适合避免过度拟合(这是小样本量的主要问题)
标签: r excel matlab data-generation