【发布时间】:2019-06-10 15:47:19
【问题描述】:
我想将文件解析为 text/xml。
我只需要解析 Microsoft Office 文档(特别是 Microsoft Word)。
我目前在我的应用程序中包含整个 tika-parsers 依赖项。
由于这很重并且包含很多我不需要的东西,如果我只对解析 Office 文档感兴趣,是否有可以安全排除的模块列表?
【问题讨论】:
标签: apache-tika
我想将文件解析为 text/xml。
我只需要解析 Microsoft Office 文档(特别是 Microsoft Word)。
我目前在我的应用程序中包含整个 tika-parsers 依赖项。
由于这很重并且包含很多我不需要的东西,如果我只对解析 Office 文档感兴趣,是否有可以安全排除的模块列表?
【问题讨论】:
标签: apache-tika
有一个Tika version,它根据它们解析的文件类型将库拆分为modules。
虽然此版本似乎不再更新,但它可以用作您正在解析的文件类型需要哪些模块的指南。
例如,查看tika-parser-advanced-module 的pom.xml,您可以看到它依赖于opennlp-tools,但tika-parser-office-module 不依赖。因此,如果您只对解析 office 文档感兴趣,可以排除 opennlp-tools。
此外,查看ivy:report(对于 maven,依赖树)会有所帮助。
如果有人对此有任何意见,我仍然愿意听取建议/cmets。
【讨论】: