【发布时间】:2018-11-20 06:17:53
【问题描述】:
原来我用的是beautifulsoup,在表格中过滤时,得到的数据如下:
["<td>9111/2018 2222/18</td>", '<td style="font-size: small;">AINDUSTRIAL </td>',
"<td>18-05-2018</td>", "<td>Juz. 5 Posá<td>POSA</td></td>",
"<td>POSA</td>"]
我只需要提取表示"Juz 5. Posá" 的"<td>"(尽管对于我正在做的事情,名称会有所不同),但我只需要该列。我留下代码,因为我设法使输出是:
Juz. 5 PosáPOSA
我只需要 Juz。 5 Posá,但不幸的是我击中了另一个词。然后是代码,当然,非常感谢!
soup = BeautifulSoup(html.text,from_encoding="utf-8")
table = soup.findChildren('table')[0]
for row in table.find_all("tr")[1:]:
col = row.find_all("td")
print(col[3].text.replace('\n',''))
if not cells:
continue
【问题讨论】:
-
不是真正的问题:
continue什么都不做,而是跳到下一个迭代而不执行它后面的语句。如果条件满足,您似乎没有任何语句可以跳过。 -
但是,为什么 beautifulsoup 过滤了我
Juz。 5 Post POSA 如果事实上,在表格中,它们是分开的:juz。 5 波萨 波萨
标签: python beautifulsoup screen-scraping