【发布时间】:2016-01-02 06:14:58
【问题描述】:
我只需要在 URL 处的 h3 中的参考下抓取文本内容,我正在尝试使用此代码,但我无法以 html 页面中显示的相同顺序获取文本。
i=43
while tree.xpath('/html/body/form/table[3]/tr/td/table[5]/tr/td/table[1]/tr/td[2]//p['+str(i)+']/a/text()')!=[] :
reference=tree.xpath('/html/body/form/table[3]/tr/td/table[5]/tr/td/table[1]/tr/td[2]//p['+str(i)+']/text()')
link_ref=tree.xpath('/html/body/form/table[3]/tr/td/table[5]/tr/td/table[1]/tr/td[2]//p['+str(i)+']//a/text()')
testo_reference=testo_reference + link_ref[0]+reference
i= i+1
我想返回一个数组,其中包含引用下的每一行,不带 html 标记,但只包含文本内容。
【问题讨论】:
标签: python html web-scraping