【发布时间】:2021-02-18 12:28:37
【问题描述】:
我是网络抓取的新手,如果之前有人问过这个问题,我深表歉意。
假设我有这个 html 代码:<a aria-current="page" aria-label="Current page" href="https://name_webpage.com/">1</a>
如何使用 python 访问<a> </a> 之间的值,即 1?
非常感谢!
【问题讨论】:
-
您可能会使用 regex 而侥幸,但对于更复杂的用途,您将需要一个专用库,例如 beautifulsoup。
-
最好避免使用正则表达式来解析 HTML。使用 HTML 解析器,就像在链接的副本中一样。有几个相关的重复,也请搜索其他的,尽管那里给出的一些答案应该足够了。
-
非常感谢您的回答! @costaparas 回答解决了我的问题!
-
您应该包含有关您用于执行抓取的包的信息 - 一个简单的 Web 客户端,例如 aiohttp 或请求?诸如 Scrapy 之类的专用工具?还是 Selenium 之类的浏览器驱动程序?这个问题的潜在答案太多了。
标签: python web-scraping