【问题标题】:classify website business domain网站业务领域分类
【发布时间】:2016-09-10 22:46:58
【问题描述】:

我想确定它所属的网站业务的类别/业务域。

例如。超人网站。该公司制作了由流行语功能和 UI 提供支持的电子邮件客户端。

所以网站的分类可以是专业的电子邮件服务

所以,为了完成这项工作,我的一些想法是在网站和公司的 Facebook 信息页面的 About_us 文本上应用 LDA 算法(python 模块),因为我们同时拥有这两者。但是这种方法在很多情况下仍然不起作用。有什么见解吗?

LDA 详细信息: 使用 20000 次通行证和 1 个主题,http://aakritiartgallery.com/ 网站的结果是

[(0, u'0.050*art + 0.020*aakriti + 0.019*contemporary + 0.017*gallery + 0.015*new')]

如何利用 LDA 给出的这些术语概率缩小我的业务范围?

【问题讨论】:

    标签: python machine-learning nlp classification


    【解决方案1】:
    1. 获取训练数据
    2. 训练分类器
    3. 分类!

    【讨论】:

      【解决方案2】:

      @Anony-Mousse 说得很好,这将有助于制定路线计划,而不是固定在单一算法上。鉴于你的情况,我会这样做。

      预处理/特征提取

      NMF、LSA、LDA 是无监督技术,主要用于预处理以提取意义特征。在 NLP 中,这通常对应于在大量文本中提取有意义的单词。通过使用这些技术,您将能够处理原始数据以获得有意义的特征。这些算法本身并不能提供预测,而且通常不足以创建一个好的模型。

      培训

      在您的情况下,您需要结构化数据来训练您的模型并进行预测。例如,您可以使用映射到业务域(或您的标签)的 LDA(您实际上会使用这些关键字的索引)的结果。

      即) (标签)IT:(功能)java、python、服务器 (标签)动物园:(特征)猴子、斑马、长颈鹿 (标签)IT:(特征)nlp,机器学习

      在您收集了一些数据后(至少 (#features * #label)),您可以训练您选择的监督模型。 (Log Reg、SVM、NN等)

      测试

      评估您的预测分数并实施算法。

      话虽如此,这可不是一件容易的事。您将不得不处理识别类别/子类别、提取有意义特征的其他方法等,所以我会在这个项目上投入很长时间。祝你好运!

      【讨论】:

      • 这很好,但是如果假设有两家公司,我什至可以分类,一家只提供有关药品的信息,另一家也出售它们,所以区分它们是很难,因为两者都具有完全相同的功能
      • 您可以将 LDA 视为粗略的“关键字生成器”,因此我会用它来预测公司的一般领域。如果要区分“药材信息”和“药材分布”,首先需要关键词以外的特征——即链接数、最常用词等。实际使用时最好不要超过1000功能——否则您将开始需要担心速度/内存性能。
      • 尽量收集尽可能多的信息,并在必要时使用特征缩减技术。此外,您需要在生成数据之前创建单独的“标签”(“药品信息”、“药品分发”、“药品生产”...)。
      • 在我看来,你想要完成的事情肯定可以通过高 F 分数来完成,但我会从一小部分业务类型开始(比如只关注与医药相关的业务)并扩展之后你的模型。希望这会有所帮助。
      猜你喜欢
      • 1970-01-01
      • 2014-02-24
      • 1970-01-01
      • 2018-08-01
      • 1970-01-01
      • 1970-01-01
      • 2012-05-27
      • 2011-09-11
      相关资源
      最近更新 更多