【问题标题】:Getting error while extracting the twitter data using Apache Flume使用 Apache Flume 提取 Twitter 数据时出错
【发布时间】:2016-04-14 04:53:53
【问题描述】:

我是 Hadoop 新手。训练并开始练习。 我正在使用 cloudera quickstart VM (CDH5.5) 进行练习。

配置的 Apache flume twitter 数据提取如下所示

设置代理属性

TwitterAgent.sources = Twitter 
TwitterAgent.channels = MemChannel 
TwitterAgent.sinks = HDFS

配置来源

TwitterAgent.sources.Twitter.type = com.cloudera.flume.source.TwitterSource TwitterAgent.sources.Twitter.channels = MemChannel TwitterAgent.sources.Twitter.consumerKey = <consumerKey> TwitterAgent.sources.Twitter.consumerSecret = <consumerSecret> TwitterAgent.sources.Twitter.accessToken = <accessToken> TwitterAgent.sources.Twitter.accessTokenSecret = <accessTokenSecret>
TwitterAgent.sources.Twitter.keywords = morning, night, hadoop, bigdata

配置渠道

TwitterAgent.channels.MemChannel.type = memory TwitterAgent.channels.MemChannel.capacity = 10000TwitterAgent.channels.MemChannel.transactionCapacity = 100

配置接收器

TwitterAgent.sinks.HDFS.channel = MemChannel 
TwitterAgent.sinks.HDFS.type = hdfs 
TwitterAgent.sinks.HDFS.hdfs.path = hdfs://localhost:9000/user/flume/tweets/ TwitterAgent.sinks.HDFS.hdfs.fileType = DataStream TwitterAgent.sinks.HDFS.hdfs.writeFormat = Text TwitterAgent.sinks.HDFS.hdfs.batchSize = 1000
TwitterAgent.sinks.HDFS.hdfs.rollSize = 0
TwitterAgent.sinks.HDFS.hdfs.rollCount = 10000

当我运行水槽来提取数据时,我收到了如下所述的错误。

警告 twitter4j.TwitterStreamImpl:角色不接受参数。 406:当请求中指定了无效格式时,由 Search API 返回。 当一个或多个参数不适合资源时,由 Streaming API 返回。例如, track 参数会在以下情况下引发此错误: track 关键字太长或太短。 指定的边界框无效。 没有为过滤的资源定义谓词,例如,既没有定义 track 也没有定义 follow 参数。 无法读取关注用户 ID。 参数track item index 0太短:

谁能帮忙解决这个错误?

【问题讨论】:

    标签: twitter4j cloudera-cdh flume-ng


    【解决方案1】:

    您在此行中使用的 hdfs 端口号不正确。 hdfs://localhost:9000/user/flume/tweets/

    正确的行应该是: hdfs://localhost:8020/user/flume/tweets

    您可以在此处查看 cloudera 中使用的端口号: http://www.cloudera.com/documentation/enterprise/latest/topics/cdh_ig_ports_cdh5.html

    此外,如果您查看收到的警告是因为 twitter4j.jar 库文件。 请确保您使用的 jar 文件正确无误。我建议您在 eclipse 中提取文件并重新构建 jar,以确保一切正确。

    查看此链接以了解如何提取 Twitter 数据。 https://www.dezyre.com/hadoop-tutorial/flume-hadoop-twitter-data-extraction

    由于您是 hadoop 新手,您可以查看他们的博客以获取更多教程和文章。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-05-20
      • 2018-04-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2022-11-17
      相关资源
      最近更新 更多