【发布时间】:2014-01-15 22:09:57
【问题描述】:
我想从数据库中下载几个特定的 DNA 序列。 (http://medicago-mutant.noble.org/mutant/FNBline1.php?id=NF-FN+8113) 我可以轻松地解析该页面上的静态链接以跟踪它们,但是从下一页我无法获得指向我要下载的文件 (http://gb.sc.noble.org/cgi-bin/gb2/gbrowse/medicago3_5/?name=CHR02FS001028027) 的链接,它位于“开始”按钮下。有没有办法获取这些信息,或者自动按下那个按钮? 该按钮触发 javascript,打开一个新窗口并立即开始下载文件。 我一直在使用 urllib2 下载这些网站,但解析链接的源代码似乎没有任何意义。
【问题讨论】:
-
你用什么来抓取? (Scrapy 等?)这将有助于澄清您正在寻求帮助的工具,或者您是否愿意切换库。
-
我使用 urllib2 模块,但我绝对愿意接受任何解决方案。
-
另外,你知道“Go”按钮是否会打开一个新窗口、立即开始下载、触发 JavaScript 事件等吗?有关您当前使用的内容(例如 urllib2)以及您遇到的具体问题的任何其他信息都非常适合包含在问题中,以方便任何可能提供帮助的人。就目前而言,这个问题可能会导致结果过于开放。
-
PS:修复第二个链接也应该有帮助,很好。 :-)
标签: javascript python web-scraping