【发布时间】:2012-08-29 15:28:17
【问题描述】:
我想写一个简单的网络蜘蛛或者只是使用wget 从谷歌学者那里下载 pdf 结果。这实际上是一种获得研究论文的好方法。
我已阅读 stackoverflow 上的以下页面:
Crawl website using wget and limit total number of crawled links
How do web spiders differ from Wget's spider?
Downloading all PDF files from a website
How to download all files (but not HTML) from a website using wget?
最后一页可能是最鼓舞人心的。我确实按照this 的建议尝试使用wget。
我的谷歌学者搜索结果页面是thus,但没有下载任何内容。
鉴于我对 webspider 的了解程度很低,我应该怎么做才能做到这一点?我确实意识到编写蜘蛛可能非常复杂,并且是我可能不想承担的项目。如果可以使用wget,那就太棒了。
【问题讨论】:
标签: unix wget web-crawler