【发布时间】:2016-02-05 14:08:45
【问题描述】:
关于使用 TensorFlow 计算 one-hot 嵌入存在一些堆栈溢出问题,以下是公认的解决方案:
num_labels = 10
sparse_labels = tf.reshape(label_batch, [-1, 1])
derived_size = tf.shape(label_batch)[0]
indices = tf.reshape(tf.range(0, derived_size, 1), [-1, 1])
concated = tf.concat(1, [indices, sparse_labels])
outshape = tf.reshape(tf.concat(0, [derived_size, [num_labels]]), [-1])
labels = tf.sparse_to_dense(concated, outshape, 1.0, 0.0)
这与官方教程中的代码几乎相同:https://www.tensorflow.org/versions/0.6.0/tutorials/mnist/tf/index.html
在我看来,既然tf.nn.embedding_lookup 存在,它可能更有效。这是一个使用它的版本,它支持任意形状的输入:
def one_hot(inputs, num_classes):
with tf.device('/cpu:0'):
table = tf.constant(np.identity(num_classes, dtype=np.float32))
embeddings = tf.nn.embedding_lookup(table, inputs)
return embeddings
您希望此实现更快吗?是否因为其他原因存在缺陷?
【问题讨论】:
-
inferior是一种主观质量。能不能客观的表达一下。例如时间、记忆、产生错误;可以测量的东西。 -
您的问题对 TensorFlow 开发人员来说是显而易见的,但对我来说不是。我发现 TensorFlow 示例非常可靠:不止一次我认为我正在改进某些东西,后来意识到他们在设计时非常小心(尽管缺乏文档)。对我来说,这个 one-hot 编码器更好(更易读、更通用、可能更快),但我想看看它是否存在我看不到的缺陷。
-
我明白了。我添加了评论,因为 StackOverflow 对问题有特定要求,如果新人看到这一点,他们可能会开始提出更多不允许的主观问题。 TensorFlow标签更宽容,但如果不遵守标准,标签将变得毫无价值,我想长期使用它。
-
我明白了。我对其进行了编辑以使其更加具体。
标签: tensorflow