【发布时间】:2019-10-25 06:40:08
【问题描述】:
在使用 scrapy 为某些网站创建爬虫时,我使用 xpath 提取了链接。但是这些链接是一些东西链接这个
https://somedomain.com/someOtherUrl;sid=someSessionIdByServer;pgid=AgainSomeIdByServer
现在我不明白为什么即使href中只有url,为什么还要附加这个sid和pgid。我使用的 xpath 代码有点像
//a/@href
我可以只得到链接吗?那么,有没有办法只获取与 Scrapy 的链接。
我可以使用一些 python 代码来提取链接。但我很想知道在 xpath 中是否有任何处理方式,或者可能是在 scrapy 中设置。
【问题讨论】:
-
你试过了吗?
//a/tokenize(@href, ';')[1] -
当我使用标记化时,它给出了无效的表达式错误。 ??????
-
“现在我不明白为什么即使href中只有url,为什么还要附加这个sid和pgid。”你检查过实际代码(不是 DOM)吗?见docs.scrapy.org/en/latest/topics/…
-
实际上是服务器将这个 pgid 和 sid 添加到链接中。我检查了网页的原始 html,然后我了解了如何访问链接。感谢您提供信息。
标签: python xpath web-scraping scrapy