【问题标题】:scrapy - how to get text from 'div'scrapy - 如何从“div”获取文本
【发布时间】:2013-06-18 23:05:28
【问题描述】:

我刚开始了解scrapy。现在我正在尝试通过以下教程进行爬行。但我很难从 div 中抓取文本。

这是 items.py

from scrapy.item import Item, Fied
class DmozItem(Item):
    name = Field()
    title = Field()
    pass

这是 dmoz_spider.py

from scrapy.spider import BaseSpider
from scrapy.selector import HtmlXPathSelector
from scrapy.item import Item

from dmoz.items import DmozItem

class DmozSpider(BaseSpider):
    name = "dmoz"
    allowed_domains = ["roxie.com"]
    start_urls = ["http://www.roxie.com/events/details.cfm?eventID=4921702B-9E3D-8678-50D614177545A594"]

    def parse(self, response):
            hxs = HtmlXPathSelector(response)
            sites = hxs.select('//div[@id="eventdescription"]')
            items = []
            for site in sites:
                    item = DmozItem()
                    item['name'] = hxs.select("text()").extract()
                    items.append(item)
            return items

现在我正在尝试通过以下命令从顶层文件夹中抓取:

scrapy crawl dmoz -o scraped_data.json -t json

但文件创建时只有 '['。

它在控制台中完美运行(通过命令每个选择),但不知何故它不能作为脚本运行。我真的是scrapy的初学者。你们能告诉我如何获取“div”中的数据吗?提前致谢。

*另外,这是我得到的。

2013-06-19 08:43:56-0700 [scrapy] INFO: Scrapy 0.16.5 started (bot: dmoz)
/System/Library/Frameworks/Python.framework/Versions/2.6/Extras/lib/python/twisted/web/microdom.py:181: SyntaxWarning: assertion is always true, perhaps remove parentheses?
assert (oldChild.parentNode is self,
2013-06-19 08:43:56-0700 [scrapy] DEBUG: Enabled extensions: FeedExporter, LogStats, TelnetConsole, CloseSpider, WebService, CoreStats, SpiderState
2013-06-19 08:43:56-0700 [scrapy] DEBUG: Enabled downloader middlewares: HttpAuthMiddleware, DownloadTimeoutMiddleware, UserAgentMiddleware, RetryMiddleware, DefaultHeadersMiddleware, RedirectMiddleware, CookiesMiddleware, HttpCompressionMiddleware, ChunkedTransferMiddleware, DownloaderStats
2013-06-19 08:43:56-0700 [scrapy] DEBUG: Enabled spider middlewares: HttpErrorMiddleware, OffsiteMiddleware, RefererMiddleware, UrlLengthMiddleware, DepthMiddleware
2013-06-19 08:43:56-0700 [scrapy] DEBUG: Enabled item pipelines: 
2013-06-19 08:43:56-0700 [dmoz] INFO: Spider opened
2013-06-19 08:43:56-0700 [dmoz] INFO: Crawled 0 pages (at 0 pages/min), scraped 0 items (at 0 items/min)
2013-06-19 08:43:56-0700 [scrapy] DEBUG: Telnet console listening on 0.0.0.0:6023
2013-06-19 08:43:56-0700 [scrapy] DEBUG: Web service listening on 0.0.0.0:6080
2013-06-19 08:43:56-0700 [dmoz] DEBUG: Crawled (200) <GET http://www.roxie.com/events/details.cfm?eventID=4921702B-9E3D-8678-50D614177545A594> (referer: None)
2013-06-19 08:43:56-0700 [dmoz] INFO: Closing spider (finished)
2013-06-19 08:43:56-0700 [dmoz] INFO: Dumping Scrapy stats:
{'downloader/request_bytes': 281,
 'downloader/request_count': 1,
 'downloader/request_method_count/GET': 1,
 'downloader/response_bytes': 27451,
 'downloader/response_count': 1,
 'downloader/response_status_count/200': 1,
 'finish_reason': 'finished',
 'finish_time': datetime.datetime(2013, 6, 19, 15, 43, 56, 569164),
 'log_count/DEBUG': 7,
 'log_count/INFO': 4,
 'response_received_count': 1,
 'scheduler/dequeued': 1,
 'scheduler/dequeued/memory': 1,
 'scheduler/enqueued': 1,
 'scheduler/enqueued/memory': 1,
 'start_time': datetime.datetime(2013, 6, 19, 15, 43, 56, 417661)}
2013-06-19 08:43:56-0700 [dmoz] INFO: Spider closed (finished)

【问题讨论】:

  • 只是为了检查一下,您希望名称字段由什么来填充? “DOC FEST:我的奥林匹亚之路”还是别的什么?
  • 是的,我也想得到电影和img文件的描述。你能告诉我我错过了什么吗?

标签: html text scrapy web-crawler


【解决方案1】:

我可以给你电影的标题,但我对 XPath 有点蹩脚,所以 XPath 的描述会在&lt;div class="tabbertab" title="Synopsis"&gt; 元素中为你提供一切。这并不理想,但它是一个起点。获取图像 URL 作为 OP 的练习。 :)

from scrapy.item import Field, Item


class DmozItem(Item):
    title = Field()
    description = Field()


class DmozSpider(BaseSpider):
    name = "test"
    allowed_domains = ["roxie.com"]
    start_urls = [
        "http://www.roxie.com/events/details.cfm?eventID=4921702B-9E3D-8678-50D614177545A594"
    ]

    def parse(self, response):
        hxs = HtmlXPathSelector(response)
        item = DmozItem()
        item["title"] = hxs.select('//div[@style="width: 100%;"]/text()').extract()
        item["description"] = hxs.select('//div[@class="tabbertab"]').extract()
        return item

【讨论】:

  • 绝对有效!谢谢塔尔瓦林。由于您的帮助,我可以抓取我想要的所有其他信息!
  • 很高兴听到。好吧,如果两个答案都有用,那么请选择最有用的作为已接受的答案,并请两者都投赞成票。 :)
【解决方案2】:

只需替换

item['name'] = hxs.select("text()").extract()

item['name'] = site.select("text()").extract()

希望对您有所帮助。

【讨论】:

  • 哦,我试过了,还是不行。它仍然使 JSON 文件仅包含 '['.
  • 好的,我已经编辑了答案(删除了[0])-这样输出的json名称值中就会有列表。
  • 耶!这是路径问题。谢谢亚历克斯!因为你的评论说它对我有用,所以我从不同的路径开始了所有的工作,并且它有效。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2016-07-16
  • 1970-01-01
  • 2022-01-07
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多