【问题标题】:read tensor file via gcloud dataproc通过 gcloud dataproc 读取张量文件
【发布时间】:2020-08-28 21:53:17
【问题描述】:

您好,我应该如何修改我的代码以正确读取 dataset2?

 %%writefile read_rdd.py 
def read_RDD(argv):
  parser = argparse.ArgumentParser() # get a parser object
  parser.add_argument('--test_set', metavar='test_set', type =ParallelMapDataset) 
  args = parser.parse_args(argv) # read the value
  args.test_set.take(3) 
  for i in args.test_set:
    print(i)               

并执行

test_set = dataset2     #dataset2 cannot be inserted
!gcloud dataproc jobs submit pyspark --cluster $CLUSTER --region $REGION \
    ./read_rdd.py \
    --  --test_set $test_set 

                                                                                                                                  aditional information                                                                                             

type(dataset2) = tensorflow.python.data.ops.dataset_ops

我尝试将 type =ParallelMapDataset 更改为 type=argparse.FileType('r') 但效果不佳

目前我无法提交作业 我正在安装

/bin/bash: -c: line 0: 意外标记附近的语法错误(' /bin/bash: -c: line 0:gcloud dataproc 作业提交 pyspark --cluster bigdatapart2-cluster --region us-central1 ./read_rdd.py -- --test_set '

【问题讨论】:

  • test_set

标签: tensorflow pyspark rdd argparse google-cloud-dataproc


【解决方案1】:

请注意,您通过gcloud dataproc jobs submit pyspark 传递的参数被转换为标准命令行。尝试用引号括起参数:

test_set = dataset2     #dataset2 cannot be inserted
!gcloud dataproc jobs submit pyspark --cluster $CLUSTER --region $REGION \
    ./read_rdd.py \
    --  --test_set "$test_set"

【讨论】:

  • 谢谢,效果很好,但是当我尝试使用 sc = pyspark.SparkContext.getOrCreate() test_set_rdd= sc.parallelize(args.test_set) 将文件类型设置为 rdd 时,我得到 TypeError: 'FileType' object is不可迭代或者当我做 argv.test_set.batch(s).take(n) 时我得到 AttributeError: 'list' object has no attribute 'test_set' 那么如何使 test _set 成为可读的 rdd 呢?
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2014-08-11
  • 2020-07-14
  • 2011-05-03
  • 2017-10-26
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多