【发布时间】:2016-02-18 08:13:38
【问题描述】:
在问这个问题之前我已经搜索了很多。我有一个程序(java),它抓取一些网页并试图找到一些 .doc 和 .pdf文件,它可以下载它们,但只有一个 .pdf 或 .doc 可以覆盖 3-4mb,这不好,因为有数百万个文件。所以我决定在不下载整个文件的情况下提取它们的文本。基本上,我需要在线查看 pdf 或 doc 文件并仅下载其文本,但我不知道该怎么做。如有必要,我可以提供我的代码。
编辑:这个问题现在可以关闭,因为我得到了这个想法和(没有)解决方案。 感谢您的帮助。
那些降级的问题是怎么回事?
【问题讨论】:
-
从 Internet 上的网站读取文件而不下载是不可能的。如果您可以控制服务器,则可以编写一个 Web 服务,该服务可以按需解析文件并提取您感兴趣的部分,然后将其发送到客户端。
-
我没有控制权。我正在抓取网页。
-
但您可以提前下载它们并获得每个的摘要。在咨询期间,您在数据中执行搜索。
-
这就是我要做的
标签: java pdf web-crawler doc