【问题标题】:Recommendations for a simple search engine for bag of words?推荐一个简单的词袋搜索引擎?
【发布时间】:2010-11-30 05:57:48
【问题描述】:

对小型、轻量级的词袋搜索引擎有什么建议吗?

我有一组“文档”,每个基本上都是一小包任意单词。 给定一个新文档,我需要获取“相似”文档的列表以及它们可能有多相似的权重。文档可能很小.. 最多几段。

  • 词干很好,但要求不高。
  • 不需要词网的词扩展。
  • 首选开源或免费软件,因为这是一个原型,而不是一个完整的项目。
  • unix/linux 平台首选。

我会将它用作子组件,并希望只为其提供带有 ID 的文档,然后会搜索与我目前拥有的“相似”文档。

【问题讨论】:

    标签: search full-text-search tags tagging


    【解决方案1】:

    我想知道 MongoDB http://www.mongodb.org/display/DOCS/Home

    似乎“全文搜索”可能是我所追求的…… 并且有额外的字段可供搜索可能会很方便。

    【讨论】:

      【解决方案2】:

      Whoosh 是一个纯 Python(无 C,无外部数据库)索引器/搜索引擎。查看documentation 了解更多信息。它确实支持词干提取。

      我在一个 mediawiki 实例的 XML 转储上进行了尝试,它似乎工作得很好!

      【讨论】:

        【解决方案3】:

        我认为Lucene 是一个选项。它应该允许您构建一个自定义的词袋搜索引擎。

        【讨论】:

          【解决方案4】:

          SolrSphinx。它们并不完全是轻量级的,但我不会推荐任何更小的项目,如果项目成功并且需要增长,切换搜索引擎可能会很痛苦。

          【讨论】:

          • 你可以在没有数据库(MySQL 或 Postgresql)的情况下使用 Sphinx,即直接用文件提供它吗?
          • 是的,使用 xmlpipe2 源:sphinxsearch.com/docs/current.html#xmlpipe2
          • 是的,我看到了。但是所有文件都是 xml 格式的吗?我的观点是,Sphinx 是一种从表或 XML 索引数据的解决方案。它不是数据库外部非结构化数据的解决方案。
          • 只需用所需的 xml 包装您的文档...与 Solr 相同(除了 Solr 有 Tika 用于处理二进制文档)
          • 如果您对 Solr 或 Sphinx 有任何疑问,我建议您创建一个真实的问题,而不是将它们发布为 cmets...
          猜你喜欢
          • 2011-02-28
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 2014-08-03
          • 1970-01-01
          • 1970-01-01
          相关资源
          最近更新 更多