【问题标题】:Preprocessing data in Multi-label classification Python多标签分类 Python 中的数据预处理
【发布时间】:2019-11-04 20:57:40
【问题描述】:

我的数据集结构:

Text: 'Good service, nice view, location'
Tag: '{SERVICE#GENERAL, positive}, {HOTEL#GENERAL, positive}, {LOCATI
ON#GENERAL, positive}'

这里的重点是我不知道如何构建我的数据框。如果你有任何建议,这些对我来说真的很好。谢谢。

【问题讨论】:

  • 我假设您有 3 个要分类的属性:SERVICE、HOTEL、LOCATION 是正确的还是有更多选项?
  • 他们还得到了房间、食品和饮料、设施......由于缺乏信息,我不知道他们到底有多少他们是如何构建他们的数据库的,我只是向你指出了我在他们的供应中发现的其他一些东西数据库。

标签: python nlp multilabel-classification


【解决方案1】:

将形容词(好、坏等)与酒店属性(服务、景观、位置)分开。您可以从创建自定义词典开始,并自动检测和利用新词作为类别。您可以使用一些名称实体识别来做到这一点,这里有一些文章:

https://towardsdatascience.com/named-entity-recognition-with-nltk-and-spacy-8c4a7d88e7da https://towardsdatascience.com/a-review-of-named-entity-recognition-ner-using-automatic-summarization-of-resumes-5248a75de175

我个人用的是斯坦福的,很酷

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2012-11-06
    • 2013-12-26
    • 2017-11-03
    • 2017-10-25
    • 1970-01-01
    • 2018-07-30
    相关资源
    最近更新 更多