【发布时间】:2018-06-05 02:56:16
【问题描述】:
我希望根据在文本 sn-ps 上训练 RNN 来生成文本序列(我之前在 articles like this 中做过)。
一个步骤是获取文本的 sn-ps 并将它们分解为子序列以训练模型:
c("E","X","A","M","P","L","E")
会变成
c("E")
c("E","X")
c("E","X","A")
...
我目前的方法是在每个单词上使用地图:
require(tidyverse)
data <- data_frame(id = c(1,2),word = list(c("E","X","A","M","P","L","E"), c("R","S","T","U","D","I","O")))
result <- data %>%
pmap(function(id,word){
subs <- map(1:length(word),function(i) word[1:i])
data_frame(id = id, sub = subs)
}) %>%
bind_rows()
但这在大型数据集上非常慢。有没有一种快速的方法来生成所有这些部分序列?
【问题讨论】: