【问题标题】:How to scrape a url containing # using python scrapy如何使用python scrapy抓取包含#的url
【发布时间】:2014-06-13 07:57:33
【问题描述】:

我正在使用 python scrapy 来抓取一个网站。 网页格式为http://www.cuponation.in/myntra-coupons#voucher-13537 它包含'#'。在将此网页抓取为 start_url 时,它会忽略 # 之后的部分。

有没有办法我可以使用 python scrapy 刮掉带有 # 的完整网址

【问题讨论】:

  • # 只会将您带到页面上的特定位置。

标签: python web-scraping scrapy fragment-identifier


【解决方案1】:

在抓取时,它通常会忽略# 之后的部分。该符号通常会将您带到网页上的<div> 标记,该标记的id 等于'voucher-13537',仅此而已。所以一旦你抓取了页面,你应该尝试寻找类似的东西:

<div id="voucher-13537"> 

这就是您要寻找的。

说到解析html文件,如果你还没用过,我建议你看看BeautifulSoup4模块。

【讨论】:

  • +1 用于提及可能更适合 OP 的 BeautifulSoup4
猜你喜欢
  • 2016-07-16
  • 1970-01-01
  • 1970-01-01
  • 2022-12-07
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2017-04-06
  • 1970-01-01
相关资源
最近更新 更多