【发布时间】:2016-03-08 18:14:16
【问题描述】:
我正在尝试确定给定的 URL 是否是任何类型的事件。 Event 我的意思是 Event,例如 conference、summit、convention 等。这是我的初步算法:
我发现了以下(查看末尾)标记,如果它们在页面的内容中(我使用第三方库从 HTML 中查找内容),那么我将其标记为事件。当然,这并不止于此。我为每个令牌分配权重,权重表示 - 这个令牌可以说明给定 url 是一个事件的强度。例如如果我在内容中找到conference,与registration相比,它会更有信心告诉我这是一个事件——它也可能经常出现在其他类型的文章中。
所以,我计算每篇文章的分数如下:
总和(内容中标记的频率 * 其权重)。然后如果这个分数是> EVENT_THRESHOLD,那么我将文章标记为事件。这种方法的问题是:如果我得到,假设出现 20 次“事件”(信心不足,即权重低),分数会跳跃并打破 EVENT_THRESHOLD 并将文章标记为事件。有没有更好的方法来实现这一点?我希望我不会重新发明轮子。谢谢。附言我不是数据科学人:(
事件代币:
("event", 0.4),
("workshop", 1.0),
("registration", 0.4),
("register", 0.3),
("conference", 1.0),
("tickets", 1.0),
("summit", 0.5),
("speaker", 0.5),
("training", 0.5),
("session", 0.4),
("convention", 1.0),
("webinar", 1.0),
("duration", 0.6)
【问题讨论】:
-
是的,您正在重新发明轮子。有大量关于事件检测的科学文章。他们中的大多数人的共同点是他们使用某种 TF-IDF。
标签: java algorithm machine-learning data-science