【发布时间】:2019-09-14 11:35:46
【问题描述】:
我正在尝试提取下表的第二列,即肌肉的名称: http://www.drjastrow.de/WAI/Vokabular/Muskeln-A1.html
到目前为止,这是我的代码:
import requests
import time
from bs4 import BeautifulSoup as soup
url = "http://www.drjastrow.de/WAI/Vokabular/Muskeln-A1.html"
links = []
time.sleep(1)
print(url)
page = requests.get(url)
text = soup(page.text, 'html.parser')
table = text.select('table')[1]
rows = table.find_all('tr')[2:]
names = []
for row in rows:
names.append(row.find_all('td')[1].text.replace('\n', ''))
print(names)
问题是它有时会得到行的第二列,有时会得到第三列,这取决于第一列是否超过两行。有道理,但我不知道如何解决。
感谢您的任何想法!
【问题讨论】:
标签: python html web-scraping beautifulsoup