【发布时间】:2020-01-23 12:12:57
【问题描述】:
我需要一些关于下采样问题的帮助。我必须制作一个更大的语料库(6 654 940 个句子,19 592 258 个标记)与一个较小的语料库(15 607 个句子,927 711 个标记)相媲美,才能在 2 个可比较的 word2vec 模型上实现它们。
每个语料库是一个列表列表,其中每个列表都是一个标记化的句子:
例如[['the', 'boy', 'eats']['the', 'teacher', 'explains']...]
我想对最大的进行下采样,使其具有与较小的相同数量的标记(保持原始数据结构:对句子进行下采样,直到获得所需的标记数量)。我是编程的初学者,我想到了两种可能的方法,但我不确定如何实现它们: - 对列表列表进行下采样 - 对训练好的word2vec模型进行下采样(我在论坛上看到有参数“sample”可以对最常用的词进行下采样但我想得到随机句子)
你能帮帮我吗?
非常感谢!! :)
【问题讨论】:
-
为什么需要将较大的语料库缩小到相似的大小? (为什么不从每个完整的语料库中制作最好的模型?)您想要丢弃大量数据的原因可能会影响哪些子采样方法是合适的。同样,您是否希望缩小的第一语料库与第二语料库在句子数、原始训练词数或实际训练词数(在消除稀有词之后)方面的大小相同,或最终学习词汇量的计数? (每个方法都会略有不同,效果也略有不同。)
-
我想训练 2 个模型,一个带有完整语料库,另一个带有第一个语料库,其大小将减少到与第二个语料库相同(我将在一个项目中讨论结果我的硕士课程)。在第二种情况下,我希望第一个语料库具有与我的第二个语料库相同数量的原始训练单词,但仍保持我的标记句子列表结构。有意义吗?
-
谢谢,但是为什么使语料库大小匹配的过程被认为很重要?与使用尽可能多的数据并适应您的资源/时间限制的通常最佳方法相比,它将提供什么好处? (我会在正式答案中提出一些关于如何做你真正要求的想法的想法,但我并不真正知道它们可能不合适/最佳的原因。)
-
非常感谢!我认为有必要将我想要比较的所有语料库都制作成相同的大小。我是一个非常初学者????
标签: python list word2vec downsampling