【问题标题】:Adding Hadoop dependencies to standalone Flink cluster将 Hadoop 依赖项添加到独立的 Flink 集群
【发布时间】:2020-12-07 07:43:24
【问题描述】:

我想创建一个带有多个任务管理器的 Apache Flink 独立集群。我想使用 HDFS 和 Hive。因此我必须添加一些 Hadoop 依赖项

阅读documentation 后,推荐的方法是设置 HADOOP_CLASSPATH 环境变量。但是我必须如何添加 hadoop 文件?我应该在任务管理器上的 /opt/hadoop 之类的目录中下载源文件并将变量设置为此路径吗?

我只知道下载带有依赖项的 Uber-Jar 并将其放在 /lib 文件夹下的旧但已弃用的方法。

【问题讨论】:

    标签: apache-flink


    【解决方案1】:

    通常您会执行标准 Hadoop 安装,因为您(对于 HDFS)需要在每台服务器上运行节点管理器(具有适当的配置),以及在 master 服务器上运行的 NameNode。

    那么你可以在 master 服务器上执行类似的操作,你将在其中提交 Flink 工作流:

    export HADOOP_CLASSPATH=`hadoop classpath`
    export HADOOP_CONF_DIR=/etc/hadoop/conf
    

    【讨论】:

    • 但是Hadoop/Cloudera集群和flink集群不同。我想在不同的机器上分散这些。所以我会将作业提交给 flink master,但这不是 NameNode。
    • 或者我可以使用maven插件下载this section中描述的依赖项。
    猜你喜欢
    • 1970-01-01
    • 2021-03-17
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多