【问题标题】:How to extract text from pdf and doc file without downloading如何在不下载的情况下从pdf和doc文件中提取文本
【发布时间】:2016-02-18 08:13:38
【问题描述】:

在问这个问题之前我已经搜索了很多。我有一个程序(java),它抓取一些网页并试图找到一些 .doc.pdf文件,它可以下载它们,但只有一个 .pdf 或 .doc 可以覆盖 3-4mb,这不好,因为有数百万个文件。所以我决定在不下载整个文件的情况下提取它们的文本。基本上,我需要在线查看 pdf 或 doc 文件并仅下载其文本,但我不知道该怎么做。如有必要,我可以提供我的代码。

编辑:这个问题现在可以关闭,因为我得到了这个想法和(没有)解决方案。 感谢您的帮助。

那些降级的问题是怎么回事?

【问题讨论】:

  • 从 Internet 上的网站读取文件而不下载是不可能的。如果您可以控制服务器,则可以编写一个 Web 服务,该服务可以按需解析文件并提取您感兴趣的部分,然后将其发送到客户端。
  • 我没有控制权。我正在抓取网页。
  • 但您可以提前下载它们并获得每个的摘要。在咨询期间,您在数据中执行搜索。
  • 这就是我要做的

标签: java pdf web-crawler doc


【解决方案1】:

这是不可能的。您只能在下载字节后开始提取文档。

(除非您还可以控制服务器,否则您可以在服务器端进行提取并提供txt 下载链接)

【讨论】:

  • 我无法控制服务器。我正在抓取数千个网站并获取文件..所以我必须下载文件。这不会是一个有效的程序,但无论如何谢谢。
  • @kaanyılmaz 是的,这将是低效的。您可以在下载时提取文件以防止必须保存它们。但恐怕这是你能得到的最好的了。
  • 下载文件后,我将提取文本并获取文件的 rif。这是我目前唯一的想法。
【解决方案2】:

不下载就从 Internet 上的网站读取文件是不可能的。

如果您可以控制服务器,则可以编写一个 Web 服务,该服务可以按需解析文件并提取您感兴趣的部分,然后将其发送到客户端。

如果没有,并且如果您要解决更具挑战性的问题,您可以编写一个 HTTP 客户端,开始下载文件并即时解析它,只下载提取部分所需的数量你需要。这可能可行,也可能不可行(或值得),具体取决于“有趣”位在文件中的位置。如果在大多数情况下它们接近开始,那么您可能能够显着减小下载大小。

有关如何完成此操作的详细说明可能超出了 StackOverflow 答案长度的准则。

【讨论】:

  • 我不知道文件的哪些部分是我下载整个文件的原因。以及那些降级是怎么回事..我没有问一个愚蠢或重复的问题。我只是找不到任何解决方案并询问社区,因为没有这样的问题。
  • 至于否决票,问题的写法听起来像是“我想做 X 但不知道如何做”,而没有解释您考虑过的方法。我们通常希望提问者提供已完成研究的证据,以免其他人重复您所做的相同工作。
  • 我想这就像我想做 X 和 Y,做了 X 但 Y 所以帮助我。
  • 以什么方式帮助你?我们不是来为您编写完整的应用程序。如果您不认为即时解析和提取将节省大量带宽,只需下载文件并处理它们。您还需要什么帮助?
  • 我没有要求给我写一个完整的应用程序。我只是问有没有办法做到这一点。祝你有美好的一天。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2016-01-20
  • 1970-01-01
  • 2021-08-22
  • 2015-10-18
  • 2016-09-11
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多