【发布时间】:2015-04-01 22:15:33
【问题描述】:
我正在尝试从 Hadoop 文件系统目录中读取/监视 txt 文件。但我注意到此目录中的所有 txt 文件本身都是目录,如下面的示例所示:
/crawlerOutput/b6b95b75148cdac44cd55d93fe2bbaa76aa5cccecf3d723c5e47d361b28663be-1427922269.txt/_SUCCESS
/crawlerOutput/b6b95b75148cdac44cd55d93fe2bbaa76aa5cccecf3d723c5e47d361b28663be-1427922269.txt/part-00000
/crawlerOutput/b6b95b75148cdac44cd55d93fe2bbaa76aa5cccecf3d723c5e47d361b28663be-1427922269.txt/part-00001
我想读取零件文件中的所有数据。我正在尝试使用此 sn-p 中显示的以下代码:
val testData = ssc.textFileStream("/crawlerOutput/*/*")
但是,不幸的是它说它不存在/crawlerOutput/*/*。 textFileStream 不接受通配符吗?我应该怎么做才能解决这个问题?
【问题讨论】:
标签: scala apache-spark spark-streaming