【发布时间】:2015-01-12 22:06:57
【问题描述】:
我即将抓取一个房地产网站的大约 50.000 条记录(使用 Scrapy)。 编程已经完成并经过测试,并且数据库设计正确。
但我想为突发事件做好准备。 那么,我如何才能完美地实际运行刮擦,并且将失败和时间损失的风险降至最低呢?
更具体地说:
- 我应该分阶段进行(小批量刮)吗?
- 我应该记录什么以及如何记录?
- 在启动之前我还应该考虑哪些其他注意事项?
【问题讨论】:
标签: python web-scraping scrapy web-crawler