【问题标题】:How to collect contact information from websites?如何从网站收集联系信息?
【发布时间】:2015-03-19 11:06:14
【问题描述】:

有人知道用于从网站收集联系方式的网络爬虫工具吗?假设我有一个 www.website/contact.. 我想提取地址、电话号码等。我一直在研究 2 个工具:用于 java 的 cralwer4j 开源 jar 和 Python 中的 Scrapy 开源。但我发现它有点难以用于我的场景。

任何建议都会很棒。谢谢

【问题讨论】:

    标签: web-scraping web-crawler scrapy google-crawlers crawler4j


    【解决方案1】:

    您可以在 Google 上搜索“simple web crawler”来找到最适合您的解决方案。在网上有很多基于“纯python”的网络爬虫。基于 sceleton 代码,您添加 db wrap up。我认为最大的问题是数据库设置和保存数据。

    如果有 1000000 个网站要抓取怎么办.. 有没有办法抓取我的所有网站?

    脚本没有问题。只需将数百万个地址放入一个文件(或多个文件)中,打开它以在 python 或其他脚本中读取。然后从中获取一个链接一个链接,并根据您的喜好进行抓取/抓取。结果您可能还想保存在文件(csv、json)中。

    我还向您推荐一个现成的simple python crawler。

    【讨论】:

    • 感谢您的回答!我想将数据保存在 csv 文件中。通过我看到的示例,问题是我需要将爬虫指向网站/域。如果有 1000000 个网站要爬,该怎么办。是有没有办法抓取我的所有网站?
    猜你喜欢
    • 2017-06-29
    • 1970-01-01
    • 2019-05-29
    • 1970-01-01
    • 2011-11-07
    • 2013-05-31
    • 2011-03-27
    • 1970-01-01
    • 2012-01-22
    相关资源
    最近更新 更多