【发布时间】:2016-04-14 04:53:53
【问题描述】:
我是 Hadoop 新手。训练并开始练习。 我正在使用 cloudera quickstart VM (CDH5.5) 进行练习。
配置的 Apache flume twitter 数据提取如下所示
设置代理属性
TwitterAgent.sources = Twitter
TwitterAgent.channels = MemChannel
TwitterAgent.sinks = HDFS
配置来源
TwitterAgent.sources.Twitter.type = com.cloudera.flume.source.TwitterSource TwitterAgent.sources.Twitter.channels = MemChannel TwitterAgent.sources.Twitter.consumerKey = <consumerKey> TwitterAgent.sources.Twitter.consumerSecret = <consumerSecret> TwitterAgent.sources.Twitter.accessToken = <accessToken> TwitterAgent.sources.Twitter.accessTokenSecret = <accessTokenSecret>
TwitterAgent.sources.Twitter.keywords = morning, night, hadoop, bigdata
配置渠道
TwitterAgent.channels.MemChannel.type = memory TwitterAgent.channels.MemChannel.capacity = 10000TwitterAgent.channels.MemChannel.transactionCapacity = 100
配置接收器
TwitterAgent.sinks.HDFS.channel = MemChannel
TwitterAgent.sinks.HDFS.type = hdfs
TwitterAgent.sinks.HDFS.hdfs.path = hdfs://localhost:9000/user/flume/tweets/ TwitterAgent.sinks.HDFS.hdfs.fileType = DataStream TwitterAgent.sinks.HDFS.hdfs.writeFormat = Text TwitterAgent.sinks.HDFS.hdfs.batchSize = 1000
TwitterAgent.sinks.HDFS.hdfs.rollSize = 0
TwitterAgent.sinks.HDFS.hdfs.rollCount = 10000
当我运行水槽来提取数据时,我收到了如下所述的错误。
警告 twitter4j.TwitterStreamImpl:角色不接受参数。 406:当请求中指定了无效格式时,由 Search API 返回。 当一个或多个参数不适合资源时,由 Streaming API 返回。例如, track 参数会在以下情况下引发此错误: track 关键字太长或太短。 指定的边界框无效。 没有为过滤的资源定义谓词,例如,既没有定义 track 也没有定义 follow 参数。 无法读取关注用户 ID。 参数track item index 0太短:
谁能帮忙解决这个错误?
【问题讨论】:
标签: twitter4j cloudera-cdh flume-ng