【发布时间】:2016-01-12 08:08:18
【问题描述】:
我正在从网站的 html 制作电子表格。我无法弄清楚如何提取未标记数据的信息。例如,我可以编写一个程序来搜索 <span class="city-names"> 中的文本,以找到大学所在的城市,但要找到大学的名称 St。圣彼得堡国立大学,没有这样的标签。有没有办法让我使用 Python 和 BeautifulSoup 将其识别为大学(例如通过识别它是未标记文本的第二个实例)?
谢谢!
<div class="result" style="width:100%;">
<span class="uppercase bold country-name" style="width:100%;">
Russia
<span class="city-names">
St. Petersburg
</span>
</span>
<br/>
<span class="bold">
<a href="http://eap.ucop.edu/OurPrograms/russia/Pages/russian_area_studies_st_petersburg.aspx" target="_blank">
Russian Area Studies, St. Petersburg - Fall
</a>
</span>
<br/>Council on International Educational Exchange, St. Petersburg
<br/>St. Petersburg State University
</div>
【问题讨论】:
-
你能假设大学总是在第二个换行符之后
<br>吗?
标签: python html beautifulsoup html-parsing