【问题标题】:Apache tika architecture & processing nodesApache tika 架构和处理节点
【发布时间】:2019-06-26 06:18:04
【问题描述】:

我刚刚开始探索 Apache Tika。 我想检查 apache tika 后台进程是如何工作的。

我尝试在独立机器上执行 Tika,但想知道它在 Cloudera Cluster 实时环境中是如何工作的。

示例:我有一个 200 页的 pdf 内容,并使用 Tika 提取文本或特征。 Tika 将使用单个节点执行此过程(即将一个文件视为一个块)还是使用多个节点执行?

我只是将 Tika 进程与 Mapreduce 进行比较,并了解 Tika 是否也在逐块处理文件。

请帮我理解这个后台进程。

我现在没有代码。

请帮助我理解这个后台进程在节点方面的工作。

【问题讨论】:

    标签: apache apache-tika


    【解决方案1】:

    我想检查一下 apache tika 后台进程是如何工作的。

    Apache Tika 在 Java 的 InputStream 类之上使用抽象 TikaInputStream。这意味着 in 将文件作为字节流读取。没有障碍,没有什么花哨的低级!

    我尝试在独立机器上执行 Tika,但想知道它在 Cloudera Cluster 实时环境中是如何工作的。

    示例:我有一个 200 页的 pdf 内容并使用 Tika 提取 文字或功能。 Tika 是否会使用单个节点执行此过程 (即将一个文件视为一个块)还是会使用 多个节点?

    我只是将 Tika 进程与 Mapreduce 进行比较,并了解 Tika 是否也是 逐块处理文件。

    由于您特别提到了 Map-Reduce,所以在 CDH 集群上使用 Apache Tika 的行为可以在 here 找到。基本上,在 CDH 上,您的 MR 应用程序将从 HDFS 读取文件(使用块方法)并使用 Apache Tika 库处理拆分,就像您在独立基础上所做的那样。请注意,处理将根据输入拆分(基础 HDFS 块)进行拆分。可以在这里找到一个工作示例: https://github.com/ppruski/tika-hadoop-mapreduce

    因此,您绝对可以使用 CDH 集群来实现并行处理的效率,因为 MR 或 Spark 都使用相同的方法来计算输入拆分。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2013-10-25
      • 1970-01-01
      • 2017-06-17
      • 1970-01-01
      • 1970-01-01
      • 2021-05-05
      • 2023-03-26
      • 1970-01-01
      相关资源
      最近更新 更多