【发布时间】:2017-06-24 23:57:06
【问题描述】:
我得到 ex that failed to append_file file is busy hdfs_non_map_reduce
我通过 spark 从 kafka 获取记录并将其放入 cassandra 和 hdfs
stream.map(somefunc).saveToCassandra
stream.map(somefunc).foreachRDD(rdd =>
fs.append.write(rdd.collect.mkstring.getBytes)
fs.close)
hdfs 中的复制因子为 1,我使用一个节点集群 spark 具有 2 个工作人员的独立集群
我不想要rdd.toDF.save("append"),因为它会生成很多文件。
有任何想法吗。
或者可能是 hdfs 有方法检查,如果文件正忙于另一个任务?
【问题讨论】:
标签: hadoop apache-spark hdfs