【发布时间】:2014-10-20 19:55:11
【问题描述】:
我有一份来自彭博、MarketWatch、CNN 等各种金融网站的新闻文章列表。我想根据文章的财务相关性对文章进行分类,以便了解是否涉及任何财务困境或任何危机。
我使用 NLTK 在 Python 中开发了一个程序,它根据每篇文章的财务相关性为每篇文章打分。
目前,我正在使用关键字列表/词典,例如:
- 市场
- 财务
- 损失
- 贷款等
并检查该列表中有多少单词出现在新闻文章中,并为每个单词记分,然后将所有单词的分数相加得到总分。
同样,我有金融短语的列表/词典:
- 未能与债权人达成协议
- 申请破产
- 第 11 章等文件
将此列表和上述列表中的分数相加,然后将总分分配给作为其相关性指标的文章。
我想在这个过程中加入机器学习,并希望将上述方法中已经分类的新闻文章作为训练集。
请帮助找到实现这一目标的最佳算法。
【问题讨论】:
-
这个问题最好在这里问:stats.stackexchange.com
标签: python machine-learning classification nltk