【发布时间】:2016-07-30 23:16:32
【问题描述】:
我是 Apache Spark 的新手,一个简单的地图函数实现为
from pyspark import SparkContext
sc = SparkContext( 'local', 'pyspark')
f = open("Tweets_tokenised.txt")
tokenised_tweets = f.readlines()
f = open("positive.txt")
pos_words=f.readlines()
f = open("negative.txt")
neg_words=f.readlines()
def sentiment(line):
global pos_words
global neg_words
pos = 0
neg = 0
for word in line.split():
if word in pos_words:
pos=pos+1
if word in neg_words:
neg=neg+1
if(pos > neg):
return 1
else:
return 0
dist_tweets=sc.textFile("Tweets_tokenised.txt").map(sentiment)
#(lambda line: sentiment(line))
dist_tweets.saveAsTextFile("RDD.txt")
基本上,我正在读取一个文件(包含标记化和词干化的推文),然后在 map 函数中对其进行简单的正负字数统计。(最后的第 3 行)但是 RDD.txt 里面什么都没有。根本没有调用函数情感。 谁能指出错误
【问题讨论】:
标签: apache-spark mapreduce pyspark