【发布时间】:2020-02-07 22:39:22
【问题描述】:
我需要使用 Python(beautifulsoup 或 scrapy)解析 HTML 文件中的信息,然后将其打印到 csv 文件中。相关信息是在我的帐户here 中看到的文件名和次数。
关于次数的相关HTML:
<div class="hidden-tiles views C C1">
<nobr class="hidden-xs">num </nobr>
<nobr class="hidden-sm hidden-md hidden-lg">num</nobr>
</div>
文件名的相关 HTML:
<div class="ttl">
{filename}
</div>
我能做什么:
import requests
page = requests.get("https://archive.org/details /%40kareem76?&sort=-publicdate&page=2")
page
page.content
nbr = BeautifulSoup(page.content, 'html.parser')
nbr.find_all('div', class_='hidden-tiles views C C1')
【问题讨论】:
-
到底是什么问题?我不确定我是否理解您要执行的操作。充其量,这只是一个需求列表。
-
@AMC 我试图达到的目标,在下面回答
-
没关系,问题还是要说清楚的。
-
@AMC 你是对的,我正在学习,这是我第一次使用 python,就像所有人一样,我处于时间的约束下
标签: python python-3.x pandas web-scraping beautifulsoup