【发布时间】:2012-03-09 05:21:10
【问题描述】:
我没有具体的代码问题我只是不确定如何使用 Scrapy 框架从逻辑上解决以下问题:
我要抓取的数据结构通常是每个项目的表格行。够直白了吧?
最终我想为每一行抓取 Title、Due Date 和 Details。 Title 和 Due Date 在页面上立即可用...
但是详细信息本身不在表格中——而是指向包含详细信息的页面的链接(如果没有意义,这里是表格):
|-------------------------------------------------|
| Title | Due Date |
|-------------------------------------------------|
| Job Title (Clickable Link) | 1/1/2012 |
| Other Job (Link) | 3/2/2012 |
|--------------------------------|----------------|
恐怕我仍然不知道如何通过回调和请求从逻辑上传递项目,即使在阅读了 Scrapy 文档的 CrawlSpider 部分之后。
【问题讨论】: