【发布时间】:2019-06-26 06:18:04
【问题描述】:
我刚刚开始探索 Apache Tika。 我想检查 apache tika 后台进程是如何工作的。
我尝试在独立机器上执行 Tika,但想知道它在 Cloudera Cluster 实时环境中是如何工作的。
示例:我有一个 200 页的 pdf 内容,并使用 Tika 提取文本或特征。 Tika 将使用单个节点执行此过程(即将一个文件视为一个块)还是使用多个节点执行?
我只是将 Tika 进程与 Mapreduce 进行比较,并了解 Tika 是否也在逐块处理文件。
请帮我理解这个后台进程。
我现在没有代码。
请帮助我理解这个后台进程在节点方面的工作。
【问题讨论】:
标签: apache apache-tika