【发布时间】:2018-06-05 08:11:59
【问题描述】:
我试图用空格分割 JavaRDD 的每个元素,除了引号和 [] 中的部分。我为此目的使用以下代码
SparkConf conf = new SparkConf().setAppName("LogAnalyzer");
JavaSparkContext sc = new JavaSparkContext(conf);
JavaRDD<String[]> logRdd = sc.textFile(logPath).map(new Function<String, String[]>() {
public String[] call(String s) {
return s.split("\\s+(?![^\\\\[]*\\\\])(?=(?:[^\\\"]*\\\"[^\\\"]*\\\")*[^\\\"]*$)");
}
});
for(String[] arr : logRdd.take(10)) {
for(String s : arr) {
System.out.print("| "+s+" |");
}
System.out.println("-------------------");
}
sc.close();
但我在运行时收到此错误
18/06/05 01:07:02 ERROR executor.Executor: Exception in task 0.0 in stage 0.0 (TID 0)
java.util.regex.PatternSyntaxException: Unclosed character class near index 49
\\s+(?![^\\[]*\\])(?=(?:[^\"]*\"[^\"]*\")*[^\"]*$)
^
当我在一个简单的 java 文件中使用它时,我没有得到这个
String[] splitted = s.split("\\s+(?![^\\[]*\\])(?=(?:[^\\\"]*\\\"[^\\\"]*\\\")*[^\\\"]*$)");
我需要在 Spark 中做其他事情吗?如果需要更多信息,请告诉我。
【问题讨论】:
标签: java apache-spark rdd