【问题标题】:Which web language can be used for data mining or web crawling哪种网络语言可用于数据挖掘或网络爬虫
【发布时间】:2010-09-12 19:41:29
【问题描述】:

如果我想建立一个复杂的网站,比如 google news ,它会从其他网站收集数据。 比如数据挖掘,爬虫。我应该用哪种语言建立网站。

目前我只知道 PHP。我可以在 PHP 中做到这一点吗

【问题讨论】:

    标签: data-mining web-crawler


    【解决方案1】:

    Python 是完成这两项任务的绝佳语言。我不能轻易说出所有可用的软件包,但首先想到的网络爬虫是Mechanize 和BeautifulSoup。 Orange 和 NLTK 实现了几种数据挖掘算法。

    【讨论】:

    • +1。我同意。我使用 Python 进行抓取,我特别使用 BeautifulSoup,有时使用 xml.dom
    【解决方案2】:

    听起来您需要构建两个应用程序,一个用于抓取网络并将数据存储在数据库中的应用程序,然后是一个用于显示收集到的数据的网站。我会使用 Perl 来抓取网络,因为它具有良好的字符串操作功能。

    【讨论】:

    • 我也在 python 中这样做。我很困惑选择 python 或 perl 什么。因为我也在考虑像谷歌一样使用 python 应用一些智能算法
    • 还有一件事。所以这意味着不需要一个脚本或应用程序来做 ecevrything。我可以有很多的组合
    • 如果您不熟悉这两种语言,我会选择 Python。它具有更简单的语法,并且拥有更大的社区和库集合。你会发现 Perl 的语法要复杂得多,没有任何额外的价值,而且它的用户群正在缩小,因为人们正在转向 Python 或 Ruby 等更新的语言。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2011-05-19
    • 1970-01-01
    • 1970-01-01
    • 2011-12-11
    • 1970-01-01
    • 1970-01-01
    • 2012-09-12
    相关资源
    最近更新 更多