【发布时间】:2014-08-14 16:43:46
【问题描述】:
我使用弹性搜索基于 2 亿条记录进行数据研究。有时需要使用新的同义词和停用词更新索引,因此应该重新索引记录。 现在,我正在尝试寻找尽快完成重新索引过程的方法。我想到了构建 elasticsearch 插件,它应该:
- 观察同义词/停用词文件更改的文件系统
- 区分以前的同义词/停用词文件
- 查找可能因同义词/停用词文件更改而受到影响的记录
- 仅重新索引在 3 上找到的记录
也许你有更好的方法请分享。
【问题讨论】:
-
你想解决什么问题?减少索引时间?我认为停用词是索引定义的一部分,你可能不得不重新索引所有的东西。
-
是的,我需要减少重新索引时间。我想停用词和同义词已加载并存储到特定的 lucene 过滤器中,因此可以重写这些过滤器以重新初始化停用词/同义词文件更改。所以我的想法是获取可能因文件更改而受到影响的记录并仅重新索引它们。
-
我理解您的担忧,但我不确定它是否会起作用。
-
为什么?有什么陷阱吗?
标签: elasticsearch