【发布时间】:2014-10-16 09:02:36
【问题描述】:
我有一个索引,其中包含大量相同字段的相同值的论文。我在这个领域有一个重复数据删除。
聚合器将作为计数器来找我。我想要一份文件清单。
我的索引:
- 文档 1 {域:'domain1.fr',名称:'name1',日期:'01-01-2014'}
- 文档 2 {域:'domain1.fr',名称:'name1',日期:'01-02-2014'}
- 文档 3 {域:'domain2.fr',名称:'name2',日期:'01-03-2014'}
- 文档 4 {域:'domain2.fr',名称:'name2',日期:'01-04-2014'}
- 文档 5 {域:'domain3.fr',名称:'name3',日期:'01-05-2014'}
- 文档 6 {域:'domain3.fr',名称:'name3',日期:'01-06-2014'}
我想要这个结果(域字段的重复数据删除结果):
- 文档 6 {域:'domain3.fr',名称:'name3',日期:'01-06-2014'}
- 文档 4 {域:'domain2.fr',名称:'name2',日期:'01-04-2014'}
- 文档 2 {域:'domain1.fr',名称:'name1',日期:'01-02-2014'}
【问题讨论】:
-
您要查找重复的文档并将其删除吗?或者从搜索结果中过滤它们?
-
我想从搜索结果中过滤掉它们
标签: elasticsearch deduplication