【发布时间】:2010-07-28 03:22:51
【问题描述】:
我正在使用 Hadoop 处理一组“大型”行分隔的完整句子。我开发了一个映射器,它应用了一些我最喜欢的 NLP 技术。我在原始句子集上映射了几种不同的技术,我在缩减阶段的目标是将这些结果收集到组中,以便组中的所有成员共享相同的原始句子。
我觉得使用整个句子作为键是一个坏主意。我觉得由于键的数量有限(不合理的信念),生成句子的一些哈希值可能不起作用。
谁能推荐为每个句子生成唯一键的最佳想法/实践?理想情况下,我想保持顺序。但是,这不是主要要求。
Avτίο,
【问题讨论】: