【发布时间】:2016-08-29 18:42:46
【问题描述】:
我的数据集包含大约 10^6 条目。但问题是数据是Imbalance。
我使用 Adboost 创建了一个线性分类器。但是由于数据不平衡,我的准确性很差。如何应对不平衡数据。我正在使用Graphlab。
这里是数据平衡的简单代码:
safe_loans_raw = loans[loans[target] == 1]
risky_loans_raw = loans[loans[target] == -1]
# Undersample the safe loans.
percentage = len(risky_loans_raw)/float(len(safe_loans_raw))
safe_loans = safe_loans_raw.sample(percentage, seed = 1)
risky_loans = risky_loans_raw
loans_data = risky_loans.append(safe_loans)
但是准确性仍然不认可,任何人都可以为此提供有效的方法吗?
【问题讨论】:
标签: algorithm machine-learning graphlab