【问题标题】:Apache Spark Word Count on PDF filePDF 文件上的 Apache Spark 字数统计
【发布时间】:2016-04-30 09:14:55
【问题描述】:

我想阅读 hdfs 中的 pdf 文件并计算字数。我知道how to do this in Map Reduce。 我需要在 Apache Spark 中做同样的事情。非常感谢您的帮助。

【问题讨论】:

    标签: apache-spark mapreduce readfile rdd


    【解决方案1】:

    这样做: 修改您引用的博客文章中的代码,以将 PDF 单词写入 HDFS 文件或将事件写入纯文本文件。该帖子引用了作者的另一篇帖子https://amalgjose.wordpress.com/2014/04/13/simple-pdf-to-text-conversion/

    然后,一旦完成 PDF 到文本的转换,就可以从 Spark 读取 HDFS 输入。

    转到http://spark.apache.org/examples.html 并查找字数示例。在 Scala、Python、Java 中有示例。这些示例甚至展示了如何指定 HDFS 位置,但您也可以使用本地文件系统。

    祝你好运

    【讨论】:

      【解决方案2】:

      SparkContext 有一个名为 hadoopFile 的方法。您需要重写 FileInputFormat,与 how to read image using spark 相同。 并阅读Pdf Input Format implementation for Hadoop Mapreduce

      【讨论】:

      • 欢迎来到 SO。不鼓励仅链接的答案。您能否在答案中包含链接的基本部分。
      猜你喜欢
      • 2018-09-24
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2022-01-19
      • 1970-01-01
      • 1970-01-01
      • 2023-01-15
      相关资源
      最近更新 更多