【发布时间】:2018-10-27 04:28:45
【问题描述】:
我是 NLP 的新手,正在学习 Word2Vec。所以我还没有完全理解 Word2Vec 的概念。
Word2Vec 的功能是否相互独立?
例如,假设有一个 100 维的 word2vec。那么这100个特征是相互独立的吗?也就是说,如果特征的“序列”被打乱了,那么word2vec的意义就改变了?
【问题讨论】:
标签: nlp word2vec text-classification word-embedding
我是 NLP 的新手,正在学习 Word2Vec。所以我还没有完全理解 Word2Vec 的概念。
Word2Vec 的功能是否相互独立?
例如,假设有一个 100 维的 word2vec。那么这100个特征是相互独立的吗?也就是说,如果特征的“序列”被打乱了,那么word2vec的意义就改变了?
【问题讨论】:
标签: nlp word2vec text-classification word-embedding
Word2vec 是一种“密集”嵌入:单个维度通常不能独立解释。只有“邻域”和“方向”(不限于 100 个正交轴维度)具有有用的含义。
因此,从统计意义上讲,它们并不是彼此“独立”的。但是,你可以丢弃任何维度——例如,所有 100 维向量的最后 50 个维度——你仍然有可用的词向量。所以从这个意义上说,它们仍然是独立有用的。
如果您以相同的方式对集合中的每个向量进行改组,那么您基本上只是类似地旋转/反射了所有向量。它们都有不同的坐标,但它们的相对距离是相同的,如果“从单词 A 向单词 B”过去模糊地表示某些人类可以理解的方面,例如“大”,那么即使在执行了您的维度顺序洗牌之后,“从单词 A 向单词 B 移动”也意味着同样的事情,因为向量“thataway”(在转换后的坐标中)将与以前相同。
【讨论】:
这里首先要了解的是 word2Vec 是如何形式化的。 word2vec 模型摆脱了传统的单词表示,试图将世界的含义编码为不同的特征。例如,让我们说英语词典中的每个单词都可以体现在一组说“4”特征中。特征可以是,比如说“f1”:“性别”、“f2”:“颜色”、“f3”:“气味”、“f4”:“经济”。
所以现在当一个 word2vec 向量被写出来时,它所表示的是它有多少特定特征的表现。让我们举个例子来理解这一点。考虑一个男人(V1),他很黑,不那么臭,不是很富有,也不穷。然后第一个特征,即性别表示为 1(因为我们将 1 表示为男性,将 -1 表示为女性)。这里的第二个特征颜色是 -1,因为它与白色完全相反(我们将其视为 1)。给定 0.3 和 0.4 的值,气味和经济性相似。 现在考虑另一个人(V2),他也与第一个人具有相同的解剖结构和社会地位。那么他的 word2vec 向量也会类似。
V1=>[1,-1,0.3,0.4]
V2=>[1,-1,0.4,0.3]
这种表示有助于我们将单词表示为彼此独立或正交的特征。正交性有助于根据一些数学运算(比如余弦点积)找到相似性或相异性。 word2vec 中数字的顺序很重要,因为每个数字都代表特定特征的权重:性别、颜色、气味、经济。所以改组位置会导致完全不同的向量
【讨论】: