【问题标题】:what kind of data can we extract from a blog or a forum for a web scraping project?我们可以从博客或论坛中为网络抓取项目提取什么样的数据?
【发布时间】:2016-04-18 22:23:39
【问题描述】:

我即将从事一个关于“分析博客或论坛中的数据”的项目,所以我想知道我们可以从博客或论坛中提取什么样的数据以及我应该如何开始

【问题讨论】:

  • 您的问题可能很有趣,但具体内容非常模糊。这是关于一个特定的博客还是一般的所有博客?您在寻找工具集还是现有项目?也许从en.wikipedia.org/wiki/Web_scraping 开始?
  • 我在谈论任何博客并寻找工具集,谢谢
  • 您正在以完全相反的方向解决问题。与其寻找某种数据,不如修复你想了解的内容。然后从博客中收集所需的数据。

标签: web-scraping web-crawler


【解决方案1】:

首先,您应该决定使用哪种编程语言。然后,您应该考虑使用网络爬虫。

不同的编程语言有不同的。对于 Java,例如有 jsoup。

要获取哪些数据,首先要考虑页面的格式。但我建议收集的数据包括:

用户名 网站上的照片 与用户名相关的数据(加入日期、帖子数量、高级会员状态、照片、电话号码、电子邮件地址、全名、地址等(如果适用)), 博客文章的标题, 在论坛上提出的问题, 每个问题的答案数量, 博文中的错别字, 日期相关信息。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2018-12-06
    • 1970-01-01
    • 1970-01-01
    • 2017-07-22
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多