【问题标题】:How to use multiple text features for NLP classifier?如何为 NLP 分类器使用多个文本特征?
【发布时间】:2020-09-10 03:26:49
【问题描述】:

我正在尝试构建文本分类器,通常,我们有一个文本列和基本事实。但我正在研究一个数据集包含许多文本特征的问题。我正在探索如何利用不同的文本功能的不同方式。

例如,我的数据集是这样的

Index_no                   domain  comment_by   comment       research_paper      books_name

01                         Science  Professor   Thesis needs  Evolution of         MOIRCS 
                                                more work     Quiescent            Deep 
                                                              Galaxies as a        Survey
                                                              Function of
                                                              Stellar Mass       



02                         Math    Professor   Doesn't follow  Evolution of   
                                               Latex format   Quiescent           nonlinear 
                                                              Galaxies as a       dispersive
                                                              Function of         equations
                                                              Stellar Mass             

这只是一个虚拟数据集,这里我的基本事实 (Y) 是域,特征是 comment_bycommentresearch_paperbooks_name

如果我使用任何 NLP 模型(RNN-LSTM、Transformers 等),这些模型通常采用一个 3 个暗向量,因为如果我使用一个有效的文本列但文本分类器有多少文本特征?

我尝试过的:

1) 加入所有列并制作一个长字符串

教授论文需要更多工作 静止星系演化作为恒星质量 MOIRCS 深度调查的函数

2) 在列之间使用标记

<CB> Professor <C> Thesis needs more work <R> Evolution of Quiescent Galaxies as a Function of Stellar Mass <B> MOIRCS Deep Survey 

&lt;CB&gt;comment_by、&lt;C&gt;comment、&lt;R&gt;research_paper、&lt;B&gt;books_name 的位置

我应该在开头使用&lt;CB&gt;还是这样使用?

Professor <1> Thesis needs more work <2> Evolution of Quiescent Galaxies as a Function of Stellar Mass <3> MOIRCS Deep Survey

3) 对每一列使用不同的密集层(或嵌入),并且 连接它们。

我已经尝试了所有三种方法,还有其他方法可以尝试提高模型的准确性吗?还是提取、组合、加入更好的特征?

提前致谢!

【问题讨论】:

  • 嘿Aaditya,你解决了上述问题吗?我也在寻找同样的解决方案。如果您已解决,请在答案中发布。

标签: machine-learning keras deep-learning neural-network nlp


【解决方案1】:

以下是您可以尝试的一些方法:

1.) 将research_paperbook_namecomment 组合成一个字符串。

2.) 将comment_by 视为分类变量并使用一个热编码器对其进行编码 或标签编码器。

3.) 无论您使用什么模型,调整超参数以改善结果。

请告诉我你得到的结果!

【讨论】:

    猜你喜欢
    • 2017-03-03
    • 1970-01-01
    • 2019-06-04
    • 1970-01-01
    • 2019-07-25
    • 2017-03-16
    • 2017-08-30
    • 2015-04-23
    • 2015-04-17
    相关资源
    最近更新 更多