【发布时间】:2020-06-13 17:17:30
【问题描述】:
所以我是网页抓取的新手,我想只抓取主页的所有文本内容。
这是我的代码,但它现在可以正常工作了。
from bs4 import BeautifulSoup
import requests
website_url = "http://www.traiteurcheminfaisant.com/"
ra = requests.get(website_url)
soup = BeautifulSoup(ra.text, "html.parser")
full_text = soup.find_all()
print(full_text)
当我打印“full_text”时,它给了我很多 html 内容,但不是全部,当我 ctrl + f " traiteurcheminfaisant@hotmail.com" 主页上的电子邮件地址时(页脚)
在全文中找不到。
感谢您的帮助!
【问题讨论】:
-
如果您打印(ra.text) 或(soup.text),您将获得包括电子邮件地址在内的完整html。我不确定为什么 BS4 没有返回电子邮件地址,但我猜这与 BS4 find_function 的工作方式有关。
标签: python web-scraping data-mining