【发布时间】:2018-10-04 22:40:56
【问题描述】:
vsample_data = credit_card.sample(n=100, replace='False')
打印(vsample_data)
在这里,我试图从数据集中抽取 100 个数据点,但无法获得正确的样本数据,从而保留信用卡欺诈数据集的原始分布,即 Class-0(非欺诈)和Class-1(欺诈)。
【问题讨论】:
-
不正确是什么意思?你得到了什么结果?
-
看看使用sklearn.train_test_split 和
stratify=Yscikit-learn.org/stable/modules/generated/… -
我只在那里获得了有时为 0 类的随机样本,并且很少出现 1 类数据点
-
是否有任何一种衬里,以便我得到与原始数据具有相同分布的两个类
标签: python-3.x pandas