【问题标题】:Apache Tika for parsing only Office docs - Build exclusionsApache Tika 仅用于解析 Office 文档 - 构建排除项
【发布时间】:2019-06-10 15:47:19
【问题描述】:

我想将文件解析为 text/xml。

我只需要解析 Microsoft Office 文档(特别是 Microsoft Word)。

我目前在我的应用程序中包含整个 tika-parsers 依赖项。

由于这很重并且包含很多我不需要的东西,如果我只对解析 Office 文档感兴趣,是否有可以安全排除的模块列表?

【问题讨论】:

    标签: apache-tika


    【解决方案1】:

    有一个Tika version,它根据它们解析的文件类型将库拆分为modules

    虽然此版本似乎不再更新,但它可以用作您正在解析的文件类型需要哪些模块的指南。

    例如,查看tika-parser-advanced-modulepom.xml,您可以看到它依赖于opennlp-tools,但tika-parser-office-module 不依赖。因此,如果您只对解析 office 文档感兴趣,可以排除 opennlp-tools

    此外,查看ivy:report(对于 maven,依赖树)会有所帮助。

    如果有人对此有任何意见,我仍然愿意听取建议/cmets。

    【讨论】:

      猜你喜欢
      • 2015-07-16
      • 2011-09-02
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-10-21
      • 1970-01-01
      • 1970-01-01
      • 2017-06-21
      相关资源
      最近更新 更多