【发布时间】:2021-02-15 23:18:27
【问题描述】:
Hadoop 提供了使用
在集群上直接运行 java 应用程序的可能性hadoop jar <jar>
现在我有一个 python 脚本而不是一个 java 应用程序。
下面是 .py 文件的构造,没有所有功能,只剩下“remove-files-from-folder”部分
import os.path
def transform():
inputfolder = "input"
for filename in os.listdir(inputfolder):
path = inputfolder + "\\" + filename
os.remove(path)
def main():
transform()
if __name__ == "__main__": main()
有没有办法像执行 .jar 文件一样执行 .py 文件?
我是 Python 和 Hadoop 的新手。如果我的方法看起来完全不对劲并且没有意义,我很高兴得到任何澄清!
【问题讨论】:
-
hadoop jar专门用于运行 MapReduce 作业。看起来您想使用 Python 操作 HDFS 上的文件?在这种情况下,您应该查看pypi.python.org/pypi/hdfs