【发布时间】:2020-09-11 04:50:28
【问题描述】:
作为一个入门项目,我使用 BS4 来识别使用 WordPress 的网站。
我无法正确获取标识符。我知道 WordPress 网站在 html 中有 /wp-content/ 链接。但我没有正确隔离它们。
以下是一些链接示例:
img src="https://variety.com/wp-content/...
href="https://variety.com/wp-content/...
我一直在玩很多变化:
find_wordpress = soup.find('a', href = "wp-content")
但我没有做对。域会改变,所以我只需要隔离 /wp-content/ 部分。
有什么建议吗?谢谢!
【问题讨论】:
-
你必须使用
regex或使用"wp-content" in href的函数 -
如果您需要所有链接,请使用
find_all -
如果你只想识别
WordPress,那么也许你应该使用if "wp-content" in html而不使用BS4 -
嗨@furas 这是一个有趣的想法!我虽然需要 BS4 才能打开并查看 html。还有其他方法吗?
-
html是一个字符串,您可以使用字符串函数或正则表达式 - 但如果您需要更复杂的东西,那么BS4或lxml更有用。有时BS4可能更有用,因为它可以使用正则表达式或函数来过滤项目。
标签: python web-scraping beautifulsoup scrapy