【问题标题】:Building a search layer index on avro serialized data在 avro 序列化数据上构建搜索层索引
【发布时间】:2014-09-17 12:59:38
【问题描述】:

我在 hdfs 上有我的 avro 序列化数据。现在我正在尝试构建一个搜索界面,我可以在其中查询 avro 数据并获取结果。我可以使用以下方法,但它有一些缺点:

反序列化 avro 数据并将其添加到 hive 存储中,并使用一些 solr/lucene 构建索引层并运行查询。 如果 avro 架构有多个层怎么办,比如

   {
        name: "xyz",
        height: "180cm",
        Cities_residing: ["X", "Y", "Z"]
        Hotels_checkedin : ["X", "Y", "Z"],
        itemX : {
            itemY : {
                itemZ : "546"
                    }
                }
    }

现在,存储上述分层数据记录会很困难。另外,我不想复制数据,例如反序列化 avro 记录并存储在某些文档存储中。它引入了很多复制。 所以,我在 avro 序列化数据(具有多个层次结构)上寻找一个 serach 工具。 如果现有工具已经在解决这个问题。请指出那些。

【问题讨论】:

  • 对您在寻找 .avro 文件中捕获的 azure eventthub 记录时找到的解决方案感兴趣?

标签: hadoop serialization solr avro


【解决方案1】:

如果您使用 Java,SortedKeyValueFile 可能是值得探索的替代方案。目前,我不知道在 python 或 C/C++ 中有类似的实现。这显然不如BigQuery 通用;但是,它可能会解决您只需要在文件中按键查询的用例。

【讨论】:

    【解决方案2】:

    大型云提供商现在拥有搜索 avro 文件的解决方案。 AWS AthenaBigQuery 是可以解决您的问题的两个服务示例。特别是如果您愿意从 hdfs 切换到 S3 或类似服务。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2020-06-20
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-03-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多