【问题标题】:Feature engineering for fraud detection欺诈检测的特征工程
【发布时间】:2018-05-14 12:50:06
【问题描述】:

我正在出于学术目的对欺诈检测进行一些研究。 我想具体了解交易数据集中的特征选择\工程技术。 更详细地说,给定一个交易数据集(例如信用卡),选择什么样的特征用于模型以及它们是如何设计的?

我遇到的所有论文都集中在模型本身(SVM、NN、...)上,并没有真正涉及到这个主题。

此外,如果有人知道未匿名的公共数据集 - 这也会有所帮助。

谢谢

【问题讨论】:

  • 这更像是一个cross-validated 的问题。实际上你可能会在那里找到一些东西,比如this question。
  • 感谢您的回复

标签: machine-learning feature-selection fraud-prevention feature-engineering


【解决方案1】:

对特征选择/排序有很好的理解对于数据科学家或机器学习从业者来说是一笔巨大的财富。掌握这些方法可以更好地执行模型,更好地理解数据的底层结构和特征,并更好地了解许多机器学习模型背后的算法。

使用特征选择通常有两个原因: 1.减少特征数量,减少过拟合,提高模型泛化能力。 2. 更好地理解特征及其与响应变量的关系。

可能的方法:

单变量特征选择:

  • 皮尔逊相关性
  • 互信息和最大信息系数 (MIC)
  • 距离相关性
  • 基于模型的排名

基于树的方法:

  • 随机森林特征重要性(平均减少杂质,平均减少准确度)

其他

  • 稳定性选择
  • RFE

【讨论】:

    猜你喜欢
    • 2021-04-11
    • 2020-07-18
    • 1970-01-01
    • 2011-04-04
    • 2013-01-14
    • 2010-09-28
    • 1970-01-01
    • 2018-12-21
    • 2018-09-19
    相关资源
    最近更新 更多