【发布时间】:2011-11-10 18:30:47
【问题描述】:
我是 xpath 的新手,所以请多多包涵。目前,我正在寻找使用scrapy从一些网页上抓取一些内容,内容看起来像这样:
<td colspan="3" valign="top" class="regular">Landsize: 84,000sq with an extensive shoreline 750m<br />
<br />
Call Or Email for more info<br />
. Full-length Olympicpool,children pool,jacuzzi<br />
\' Landscapesdkey bridges<br />
. 2 tennis courts<br />
. water features True seafront development with iconic design by architect Daniel Libeskind<br />
lconic residential, located less than\' 150 metres from the shoreline<br />
<br />
opposite the future integrated resort on sentosa Island.<br />
A part of keppel Bay world calss water front precinct with luxury homes.<br />
<br />
Call or email for more info </td>
具体来说,我使用的是下面的hxs.select('//tr[contains(td,"Description")]/following-sibling::tr[1]/td/text()').extract()
但是,由于内容由<br> 分隔,因此这样做会将结果项分成一个列表。如果我从 xpath 中排除 text(),<td> 元素将包含在结果字符串中,这是不可取的。
在 xpath 中有没有办法确保我的结果字符串是上面显示的所有内容,但没有 td 标签?我希望我不需要通过<br/>手动加入列表
【问题讨论】: