【发布时间】:2019-05-03 09:56:59
【问题描述】:
我正在研究关键短语提取,现在我能够创建一些特征并运行候选短语以及用于训练使用随机森林进行分类的机器学习模型的特征。
现在出于好奇,我想尝试深度学习,因为我想手动移除特征提取层,我希望它自己找出特征并通过传递一些文本文档和相关键来生成模型我想知道每个文档的短语(正确或不正确的 1/0),是否有任何训练模型接受纯文本而不是浮点值,如果不是,我如何尝试通过将句子和关键短语转换为浮点值和传递给训练模型
甚至尝试使用 Keras Sequential 模型创建模型(已给出示例)
model = Sequential()
model.add(Dense(18, input_dim=14, init='uniform', activation='relu'))
model.add(Dense(14, init='uniform', activation='relu'))
model.add(Dense(1, init='uniform', activation='sigmoid'))
# Compile model
model.compile(loss='binary_crossentropy', optimizer='adam', metrics=['accuracy'])
# Fit the model
model.fit(X, Y, epochs=300, batch_size=10)
Please provide me any informative resources to start and has code samples as well.
【问题讨论】:
-
一项非常好的工作是使用 BERT 作为文本摘要的工具(我怀疑这就是你想要的)。这里有一篇很好的文章可以帮助你朝这个方向发展 (arxiv.org/pdf/1902.09243.pdf - (4 月 12 日))。您还可以在网络的开头使用嵌入层来自动从单词中获取浮动(您只需先将单词映射到整数,但这不是 ML 部分)。
-
每个文档都标记有一个关键词还是多个关键词?
-
@mujjiga 每个文档都标有多个关键词。
标签: machine-learning keras neural-network deep-learning conv-neural-network