【发布时间】:2020-04-03 02:05:14
【问题描述】:
我正在研究关于异常值检测的学校项目。我想我会创建自己的小数据集并使用 DBSCAN 来处理它。我想我会尝试创建一个关于点击网站上的广告是否作弊的数据集。下面是我要创建的数据集的详细信息。
数据集名称:作弊广告点击检测。
列:值
来源: (分类)网址:0,重定向:1,搜索:2
visited_before: (分类)编号:1,few_time:1,粉丝:2
time_on_site(秒): (数字)用户在离开前在网站上工作的时间(以秒为单位)。
active_type: (分类) fake_active:0(就像他们只是打开网站但除了点击广告什么都不做),normal_active:1,real_acive:2(也许我会让它变成分数活动的:从 0 到 10 的浮点值。)
作弊(标签): (分类)否:0,是:1
也许我会有更多其他列,例如用户点击广告的次数,...
我的问题是你认为 DBSCAN 可以在这个数据集上很好地工作吗?如果是,您能否给我一些提示以制作出色的数据集或更快地创建数据集?如果没有,请向我推荐一些 DBSCAN 可以很好地与主题配合使用的其他数据集。
非常感谢。
【问题讨论】:
标签: python machine-learning dataset outliers dbscan