【发布时间】:2016-04-30 09:14:55
【问题描述】:
我想阅读 hdfs 中的 pdf 文件并计算字数。我知道how to do this in Map Reduce。 我需要在 Apache Spark 中做同样的事情。非常感谢您的帮助。
【问题讨论】:
标签: apache-spark mapreduce readfile rdd
我想阅读 hdfs 中的 pdf 文件并计算字数。我知道how to do this in Map Reduce。 我需要在 Apache Spark 中做同样的事情。非常感谢您的帮助。
【问题讨论】:
标签: apache-spark mapreduce readfile rdd
这样做: 修改您引用的博客文章中的代码,以将 PDF 单词写入 HDFS 文件或将事件写入纯文本文件。该帖子引用了作者的另一篇帖子https://amalgjose.wordpress.com/2014/04/13/simple-pdf-to-text-conversion/
然后,一旦完成 PDF 到文本的转换,就可以从 Spark 读取 HDFS 输入。
转到http://spark.apache.org/examples.html 并查找字数示例。在 Scala、Python、Java 中有示例。这些示例甚至展示了如何指定 HDFS 位置,但您也可以使用本地文件系统。
祝你好运
【讨论】:
SparkContext 有一个名为 hadoopFile 的方法。您需要重写 FileInputFormat,与 how to read image using spark 相同。 并阅读Pdf Input Format implementation for Hadoop Mapreduce
【讨论】: