【发布时间】:2018-09-19 11:10:27
【问题描述】:
我正在尝试构建一个 ML 分类模型,用于在帐户注册时进行欺诈检测。我手头的数据是:姓名、电子邮件地址、坐标(注册时 IP 地址的纬度和经度)和标签(欺诈与非欺诈)。以下是我的数据集的简短摘要:
>>> dataset.summary
Index(['name', 'email','latitude','longitude','label'],dtype='object')
>>> dataset.shape
(93207, 4)
到目前为止,我在训练模型时无法理解如何处理坐标变量。 StackExchange 上的一些用户建议使用正弦和余弦函数的某些组合将纬度和经度转换为 X、Y 和 Z 坐标。 (即https://datascience.stackexchange.com/questions/13567/ways-to-deal-with-longitude-latitude-feature)但我不知道这在我的分类用例中是否真的必要?我曾考虑将纬度和经度组合成每条记录的 1 个变量。但是,某些地区的经度值为负值。此外,一些欺诈者可能位于高纬度和经度区域,而其他欺诈者可能位于低纬度和经度区域。因此,也许将纬度和经度组合成 1 个变量无助于训练模型?
我还可以将纬度和经度转换为城市名称。但如果我这样做了,一个城市的拼写就会与另一个很远的城市有相似的拼写,这也可能无助于训练模型。有什么建议吗?
【问题讨论】:
标签: python pandas machine-learning classification coordinates