【发布时间】:2011-12-10 04:23:11
【问题描述】:
我的问题是我需要比较 URL 路径并推断它们是否相似。下面我提供要处理的示例数据:
# GROUP 1
/robots.txt
# GROUP 2
/bot.html
# GROUP 3
/phpMyAdmin-2.5.6-rc1/scripts/setup.php
/phpMyAdmin-2.5.6-rc2/scripts/setup.php
/phpMyAdmin-2.5.6/scripts/setup.php
/phpMyAdmin-2.5.7-pl1/scripts/setup.php
/phpMyAdmin-2.5.7/scripts/setup.php
/phpMyAdmin-2.6.0-alpha/scripts/setup.php
/phpMyAdmin-2.6.0-alpha2/scripts/setup.php
# GROUP 4
//phpMyAdmin/
我试过 Levenshtein 距离来比较,但对我来说不够准确。我不需要 100% 准确的算法,但我认为 90% 及以上是必须的。
我认为我需要某种分类器,但问题是新数据的每个部分都可以包含应该分类到新的未知类的路径。
请您指引我往右边走好吗?
谢谢
【问题讨论】:
-
所以,基本上,你有一组 URL,你想把它分成分离集(做clustering),或者更准确地说你的任务是什么?我也猜想,类的数量是先验的,对吧?
-
*disjunctive -> 不相交
-
是的,你是对的,我的任务是某种聚类。问题是数据总是来的,所以算法应该适应新数据——可以增加类的数量。此任务是预处理数据以在下一步中使用它们。我想要实现的是了解请求了哪个应用程序/脚本,对我来说,它是 phpMyAdmin 版本 2.5.6 还是 2.6.0 没有区别 - 我需要知道请求了 phpMyAdmin setup.php 脚本。我希望这可以帮助您理解我的问题
标签: algorithm data-mining classification levenshtein-distance text-mining